"МТС", Работа в IT

Стажер Data Engineer в Аналитику для сервиса Заявки Телеком данных [Big Data, МТС Веб Сервисы]

Москва, Технопарк, Замоскворецкая линия, метро ТехнопаркПолная занятостьне требуется

О компании

МТС — крупный российский телеком- и IT-игрок, развивающий собственные цифровые сервисы и инфраструктуру данных. Направление Big Data в компании описано как один из ключевых юнитов: это масштабная работа с метриками и профилями, поддерживающая продуктовые сценарии и аналитические контуры.

Немного о нас в цифрах:

  • 20 петабайт данных в контуре Big Data
  • 5 000 метрик на профиль
  • 400 специалистов в команде Big Data
  • 5 000 метрик на профиль и аналитические витрины в составе платформы

О вакансии

Команда центра Big Data в МТС развивает аналитику и контур Data Governance для сервисов, где ключевую роль играют инженерные процессы обработки и доставки данных. В рамках этого направления открыта стажёрская позиция Data Engineer в аналитическую часть Data Governance.

На стажировке вы будете участвовать в инженерных задачах, которые превращают разрозненные источники данных в управляемые пайплайны и витрины. Контекст роли — Big Data в масштабе платформы МТС: от ETL и агрегаций до загрузки данных в хранилища и витрины.

Формат обучения — с кураторами: для стажёра важно иметь сопровождение, чтобы быстрее включиться в работу и разобраться в практиках команды.

Чем предстоит заниматься:

  • Разрабатывать ETL-процедуры для сервисов datagov
  • Строить обработку данных на Python и PySpark
  • Участвовать в сборке пайплайнов на базе Hadoop и Airflow
  • Подключать и собирать данные из реляционных и нереляционных источников
  • Наполнять витрины в Hive
  • Загружать данные в целевые хранилища (PostgreSQL, ClickHouse, Greenplum)

Что мы предлагаем:

  • Работа в связке с куратором
  • Стажировка с понятным графиком и внутренними условиями
Навыки
PythonSQLPySpark

Обязанности

  • Разработка ETL-процедур для сервисов datagov на Python и PySpark
  • Участие в построении пайплайнов обработки с использованием Hadoop и Airflow
  • Сбор данных из различных реляционных и нереляционных источников
  • Создание и наполнение витрин данных для аналитических задач
  • Загрузка данных в Hive
  • Загрузка данных в PostgreSQL, ClickHouse и Greenplum

Похожие вакансии

Как получить эту работу — с ИИ-помощником РаботаМакс

Бесплатно поможем на каждом шаге. Нажмите, чтобы раскрыть.