Data Engineer (Hadoop / Spark)

По договоренности


«Детмир Тех» развивает цифровую экосистему группы компаний «Детский мир». Мы создаём продукты для миллионов клиентов и сервисы, которые помогают бизнесу принимать решения на основе данных.

Ищем Data Engineer в команду Big Data Platform. Платформа построена на Hadoop 3 и Apache Spark и является основным источником данных для всей группы компаний.

Главная задача — развивать надёжную и производительную платформу обработки больших объёмов данных: проектировать пайплайны, оптимизировать Spark-приложения, развивать Data Lake и совершенствовать архитектуру Hadoop-кластера.

Чем предстоит заниматься:

  • Разрабатывать и оптимизировать batch-процессы на Apache Spark.
  • Проектировать ETL/ELT-пайплайны для обработки больших объёмов данных.
  • Создавать и поддерживать витрины данных в Hadoop.
  • Оптимизировать Spark jobs: partitioning, shuffle, data skew, использование памяти и ресурсов кластера.
  • Развивать архитектуру Data Lake и подходы к организации и хранению данных.
  • Организовывать загрузку и передачу данных через Kafka и S3 API (MinIO).
  • Автоматизировать процессы с помощью Apache Airflow и Apache NiFi.
  • Поддерживать трансформации данных в dbt Core.
  • Развивать и поддерживать витрины данных в ClickHouse.
  • Оптимизировать запросы и процессы загрузки данных в ClickHouse, разбираться с проблемами производительности.
  • Поддерживать аналитическую платформу на Apache Superset, решать возникающие технические проблемы.
  • Внедрять проверки качества данных и мониторинг пайплайнов.
  • Исследовать причины сбоев и деградации производительности.
  • Помогать аналитикам и дата-сайентистам эффективно работать с платформой.
  • Участвовать в развитии внутренних инструментов и стандартов Data Engineering.
  • Участвовать в развёртывании и эксплуатации компонентов платформы в Kubernetes.

Что для нас важно:

  • От трёх лет опыта работы с Hadoop и Apache Spark.
  • Знание основных компонентов Hadoop и принципов работы HDFS и Spark.
  • Глубокое понимание архитектуры Spark и принципов распределённых вычислений.
  • Опыт разработки и оптимизации Spark batch jobs.
  • Уверенное владение SQL.
  • Опыт проектирования DWH или Data Lake.
  • Опыт построения ETL/ELT-процессов.
  • Практический опыт работы с Apache Airflow.
  • Знание форматов хранения данных.
  • Понимание принципов партиционирования и организации данных в Data Lake.
  • Умение диагностировать проблемы с shuffle, partitioning, data skew, памятью и использованием ресурсов кластера.
  • Умение анализировать производительность распределённых приложений и находить узкие места.
  • Умение писать чистый, тестируемый и поддерживаемый код.
  • Готовность принимать технические решения и отвечать за результат.

Будет преимуществом:

  • Опыт разработки на Scala.
  • Знание Kafka и принципов потоковой обработки данных.
  • Опыт работы с ClickHouse и оптимизации запросов.
  • Опыт работы с Apache Superset.
  • Знакомство с Apache NiFi и dbt Core.
  • Опыт эксплуатации приложений в Kubernetes.
  • Знание Docker, Helm и GitLab CI/CD.
  • Опыт работы с DataHub или другими Data Catalog решениями.
  • Опыт построения мониторинга data-платформ и пайплайнов.
  • Знакомство с VictoriaMetrics, Grafana, Hue или Jupyter.
  • Опыт работы с большими Hadoop-кластерами и высокими объёмами данных.

Наш стек:

Хранение и обработка: Hadoop 3, HDFS, Apache Spark

Доставка и обмен данными: Kafka, S3

Оркестрация и трансформации: Apache Airflow, Apache NiFi, dbt Core

Аналитические хранилища: ClickHouse

Ad-hoc аналитика: Hue, Jupyter

Каталог данных: DataHub

BI и визуализация: Apache Superset, Grafana

Мониторинг: VictoriaMetrics, Grafana

Инфраструктура: Kubernetes, Docker, Helm

CI/CD: GitLab CI/CD

Мы предлагаем:

  • Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию;
  • Совокупный доход: оклад + годовой бонус;
  • График работы: 5/2 (гибридный формат работы);
  • Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается;
  • Техника для работы;
  • Полис ДМС;
  • Программа Best Benefits;
  • Внутреннее обучение;
  • Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании.

Присоединяйтесь к нам и станьте частью истории бренда с историей!


Поделиться:

Опубликована 5 часов назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
... требований к данным; будет дополнительным плюсом: опыт работы в bi инструментах (qlik sense\superset\data ...
  • Можно удаленно
  • Подработка
  • Опыт от 3 лет
Логотип компании ДивергентДивергент
  • Москва
день назад
Мы в поиске Data Engineer, готового обеспечить создание и развитие новой Федеральной государственной ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании ВебпроВебпро
  • Москва
день назад
В связи с активным развитием проектов в компании открыта вакансия Data Engineer. ... Опыт работы с инструментами Data Quality (dbt, Great Expectations и аналоги). ... Мы ищем Middle Data Engineer в команду, которая развивает наш Data Management Platform (DMP).
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании ИЦ АЙ-ТЕКОИЦ АЙ-ТЕКО
  • Москва
5 дней назад
Мы команда, которая работает с большими данными и строит передовые data-driven решения.
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании RWB (Wildberries & Russ)RWB (Wildberries & Russ)
  • Москва
7 дней назад
В Департаменте по работе с данными открыта вакансия Data Engineer. ... Oracle, GreenPlum; Масштабирование процессов: внедрение стандартов код-ревью, тестирования данных (data ... Будет плюсом: Опыт бэкенд-разработки или построения data-инфраструктуры с нуля; Опыт работы с хранилищами ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Московская БиржаМосковская Биржа
  • Москва
10 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.