Data Engineer (Kandinsky)

По договоренности


Ищем талантливых специалистов в команду Управления базовых моделей Kandinsky.

Kandinsky — линейка моделей для генерации изображений и видео по текстовому описанию. Наша команда занимается обучением и развитием модели, аналитикой и построением метрик её работы, специализируется на создании инновационных решений в области искусственного интеллекта и нейросетей. Мы разрабатываем модели, направленные на улучшение взаимодействия между человеком и AI, автоматизацию процессов анализа больших объемов данных, распознавание изображений и обработку естественного языка, а также создание креативных инструментов для автоматической генерации визуального контента высокого уровня.

Обязанности

  • проектирование и разработка ETL/ELT-пайплайнов для обработки изображений и видеоданных, как в экосистеме Apache Airflow, так и в формате автономных Python-скриптов.
  • автоматизация процессов загрузки, предобработки и анализа данных: загрузка изображений и видео, обработка полученных данных, определение технических артефактов (например, наличие чёрных полос), трансформация и подготовка данных под требуемые форматы.
  • проектирование и поддержка высоконагруженных пайплайнов с возможностью масштабирования на распределённую обработку.
  • разработка высоконагруженных процессов нарезки, сжатия и конвертации видеофайлов крупного размера с использованием оптимизированных инструментов (ffmpeg, multiprocessing, async-подходы)
  • реализация механизмов отслеживания состояния и истории данных: учёт уже обработанных файлов, планирование задач по догрузке, ведение служебных таблиц
  • поддержка платформы данных: создание и оптимизация DDL/DML-скриптов, настройка таблиц под аналитические и операционные нагрузки
  • подготовка датасетов по требованиям внутренних и внешних заказчиков, обеспечение качества и полноты данных
  • поддержка CI/CD-процессов и стандартизация кодовой базы в соответствии с инженерными практиками и паттернами проектирования.

Требования

  • уверенный практический опыт разработки ETL-процессов с использованием Apache Airflow либо аналогичных систем оркестрации
  • опыт работы с S3 или совместимыми объектными хранилищами, понимание структуры и принципов организации data-lake
  • понимание принципов распределённой обработки данных и работы PySpark
  • уверенные навыки разработки на Python, включая использование асинхронных инструментов, многопроцессной обработки, работы с большими файлами и медиа-данными
  • опыт написания Bash-скриптов для автоматизации рутинных процессов.
  • глубокое понимание принципов проектирования чистой архитектуры, шаблонов проектирования и построения легко-поддерживаемых модульных систем
  • опыт работы с PostgreSQL и ClickHouse, навыки написания оптимизированных запросов и проектирования таблиц
  • опыт работы с Docker и Kubernetes, понимание контейнеризации пайплайнов данных.

Условия

  • конкурентный уровень заработной платы, годовые премии по результатам работы
  • участие в развитии и создании OpenSource продуктов
  • корпоративная пенсионная программа, страхование от несчастных случаев, социальные гарантии, ДМС
  • комфортный офис Sbergile Home (метро Кутузовская).

Поделиться:

Опубликована 8 дней назад

Похожие вакансии

Эта вакансия размещена в рамках HR-направления нашего ИТ-агентства letitgo.agency. Мы помогаем найти специалиста не в нашу команду, а в штат компании-партнёра. Обязанности: Контроль качества данных, внедрение проверок и мониторинг корректности витрин...
  • Полный день
  • Опыт от 3 лет
Логотип компании letitgo.agencyletitgo.agency
  • Москва
6 дней назад
до 380 000 ₽
Выше средней на 20%
Обязанности: Контроль качества данных, внедрение проверок и мониторинг корректности витрин. Разработка и поддержка витрин данных Проектирование и оптимизация SQL-запросов для формирования витрин и проверок качества данных. Взаимодействие с командами ...
  • Полный день
  • Опыт от 3 лет
Логотип компании Outlines TechnologiesOutlines Technologies
  • Москва
7 дней назад
Группа Rubytech — лидирующий производитель программно-аппаратных комплексов и разработчик технологий для высоконагруженных ИТ-инфраструктур. Мы выпускаем собственную линейку ПАК Скала^р, а также строим и защищаем от киберугроз инфраструктуру, обеспеч...
  • Полный день
  • Опыт от 3 лет
Логотип компании RubytechRubytech
  • Москва
15 дней назад
Делаем банк для тех, кто живёт жизнь. И сами следуем этому принципу: любим спортик, вкусную еду, красивые вещи, встречи с друзьями. А ещё считаем, что всё вокруг должно быть в удовольствие — в том числе банкинг. Для нас важно быть визионерами во всём...
  • Полный день
  • Опыт от 3 лет
Логотип компании РокетбанкРокетбанк
  • Москва
16 дней назад
МГТС — основной телекоммуникационный партнер Города Москвы и часть экосистемы МТС. Проектируем, строим и эксплуатируем передовую телекоммуникационную инфраструктуру, развиваем и внедряем сети нового поколения, реализуем комплексные решения для Умного...
  • Полный день
  • Опыт от 3 лет
Логотип компании МТСМТС
  • Москва
16 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.