ООО Блейз Аналитикс

Ведущий инженер данных / Lead Data Engineer

Москва, Банковский переулок, 2/5Полная занятость3–6 лет

О компании

Blaze Analytics — команда, которая занимается построением аналитических платформ и решений по управлению данными. Компания помогает крупным организациям и госструктурам пройти путь от разрозненных legacy-систем к современной Data Platform, где данные подготавливаются, хранятся и используются более предсказуемо и масштабируемо.

Ключевые факты:

  • Акцент на Data Platform и трансформации legacy DWH в современную архитектуру
  • Участие в проектах для крупных компаний и государственных организаций

О вакансии

Вы будете работать в направлении аналитических платформ и управления данными. Сейчас команда усиливается для проекта по построению Data Lakehouse для крупного государственного заказчика: идет активная миграция сотен потоков данных из legacy DWH в гибридную архитектуру.

Команда применяет стек для распределенной аналитики и хранения в открытых табличных форматах. На проекте вы будете разрабатывать ETL-модули, автоматизировать типовые участки переноса и участвовать в оптимизации решений.

По мере роста роли предполагается управление инженерами данных: планируется возглавить группу из 3–4 специалистов, а также взять на себя часть организационно-технических задач.

Чем предстоит заниматься:

  • Разрабатывать модули ETL на базе PySpark и сценариев для запуска в Airflow
  • Создавать переиспользуемые шаблоны и модули автоматизации ETL-процедур
  • Оптимизировать Spark-приложения и решения для обработки данных
  • Участвовать в переносе потоков из legacy DWH в Data Lakehouse/гибридную архитектуру
  • Поддерживать и развивать интеграции в составе пайплайна данных (Kafka и CDC-компоненты)
  • Участвовать в выстраивании стандартов разработки, стендов и инструкций развертывания
  • Декомпозировать крупные задачи на подзадачи и делегировать их инженерам
  • Валидировать результаты разработки и следить за соблюдением общих стандартов
  • Проводить технические демо функционала для заказчика

Что мы предлагаем:

  • Гибридный формат при обязательном нахождении в Москве: 2–3 дня в офисе заказчика в неделю
  • Работа в аккредитованной IT-компании
  • Белая зарплата дважды в месяц с возможностью роста
  • Покупка техники: ноутбук и монитор
  • Разные варианты оформления: в штат или по ГПХ

Обязанности

  • Разработка ETL-модулей с использованием PySpark и инструментов оркестрации
  • Создание автоматизации ETL-процедур через переиспользуемые шаблонные компоненты
  • Оптимизация разработанных решений и производительности Spark-приложений
  • Участие в проекте построения Data Lakehouse и переносе потоков данных из legacy DWH
  • Работа в связке с распределенной аналитикой CedrusData (Trino) и табличными форматами
  • Развитие пайплайнов на базе Airflow для запуска и управления обработкой данных
  • Интеграция потоков данных через Kafka и CDC-компоненты (Debezium)
  • Выстраивание процессов разработки: стандарты, CI/CD, стенды, инструкции развертывания
  • Техническое сопровождение: валидация результатов и контроль соответствия стандартам
  • Декомпозиция задач и делегирование команде инженеров
  • Проведение технических демо для заказчика

Условия

  • Гибридный формат: обязательно быть в Москве, 2–3 дня в офисе заказчика в неделю
  • Работа в аккредитованной IT-компании
  • Белая зарплата дважды в месяц с возможностью роста
  • Покупка техники: ноутбук и монитор
  • Варианты оформления: в штат или по ГПХ
  • Можно рассчитывать на расширение зоны влияния и участие в развитии процессов в компании (низкий уровень бюрократии)
  • Есть перспектива роста до руководителя группы инженеров данных

Похожие вакансии

Как получить эту работу — с ИИ-помощником РаботаМакс

Бесплатно поможем на каждом шаге. Нажмите, чтобы раскрыть.