Data Engineer (Kandinsky)
По договоренности
Ищем талантливых специалистов в команду Управления базовых моделей Kandinsky.
Kandinsky — линейка моделей для генерации изображений и видео по текстовому описанию. Наша команда занимается обучением и развитием модели, аналитикой и построением метрик её работы, специализируется на создании инновационных решений в области искусственного интеллекта и нейросетей. Мы разрабатываем модели, направленные на улучшение взаимодействия между человеком и AI, автоматизацию процессов анализа больших объемов данных, распознавание изображений и обработку естественного языка, а также создание креативных инструментов для автоматической генерации визуального контента высокого уровня.
Обязанности
- проектирование и разработка ETL/ELT-пайплайнов для обработки изображений и видеоданных, как в экосистеме Apache Airflow, так и в формате автономных Python-скриптов.
- автоматизация процессов загрузки, предобработки и анализа данных: загрузка изображений и видео, обработка полученных данных, определение технических артефактов (например, наличие чёрных полос), трансформация и подготовка данных под требуемые форматы.
- проектирование и поддержка высоконагруженных пайплайнов с возможностью масштабирования на распределённую обработку.
- разработка высоконагруженных процессов нарезки, сжатия и конвертации видеофайлов крупного размера с использованием оптимизированных инструментов (ffmpeg, multiprocessing, async-подходы)
- реализация механизмов отслеживания состояния и истории данных: учёт уже обработанных файлов, планирование задач по догрузке, ведение служебных таблиц
- поддержка платформы данных: создание и оптимизация DDL/DML-скриптов, настройка таблиц под аналитические и операционные нагрузки
- подготовка датасетов по требованиям внутренних и внешних заказчиков, обеспечение качества и полноты данных
- поддержка CI/CD-процессов и стандартизация кодовой базы в соответствии с инженерными практиками и паттернами проектирования.
Требования
- уверенный практический опыт разработки ETL-процессов с использованием Apache Airflow либо аналогичных систем оркестрации
- опыт работы с S3 или совместимыми объектными хранилищами, понимание структуры и принципов организации data-lake
- понимание принципов распределённой обработки данных и работы PySpark
- уверенные навыки разработки на Python, включая использование асинхронных инструментов, многопроцессной обработки, работы с большими файлами и медиа-данными
- опыт написания Bash-скриптов для автоматизации рутинных процессов.
- глубокое понимание принципов проектирования чистой архитектуры, шаблонов проектирования и построения легко-поддерживаемых модульных систем
- опыт работы с PostgreSQL и ClickHouse, навыки написания оптимизированных запросов и проектирования таблиц
- опыт работы с Docker и Kubernetes, понимание контейнеризации пайплайнов данных.
Условия
- конкурентный уровень заработной платы, годовые премии по результатам работы
- участие в развитии и создании OpenSource продуктов
- корпоративная пенсионная программа, страхование от несчастных случаев, социальные гарантии, ДМС
- комфортный офис Sbergile Home (метро Кутузовская).
Опубликована месяц назад
Похожие вакансии
Группа Rubytech — лидирующий производитель программно-аппаратных комплексов и разработчик технологий для высоконагруженных ИТ-инфраструктур. Мы выпускаем собственную линейку ПАК Скала^р, а также строим и защищаем от киберугроз инфраструктуру, обеспеч...
- Полный день
- Опыт от 3 лет
- Москва
6 дней назад
Делаем банк для тех, кто живёт жизнь. И сами следуем этому принципу: любим спортик, вкусную еду, красивые вещи, встречи с друзьями. А ещё считаем, что всё вокруг должно быть в удовольствие — в том числе банкинг. Для нас важно быть визионерами во всём...
- Полный день
- Опыт от 3 лет
- Москва
6 дней назад
МГТС — основной телекоммуникационный партнер Города Москвы и часть экосистемы МТС. Проектируем, строим и эксплуатируем передовую телекоммуникационную инфраструктуру, развиваем и внедряем сети нового поколения, реализуем комплексные решения для Умного...
- Полный день
- Опыт от 3 лет
- Москва
6 дней назад
Мы ищем Middle Data Engineer в команду «Данные СберНПФ». Проект включает работу с корпоративным хранилищем данных и реализацию стандарта МСФО 17. Чем предстоит заниматься: Настройка потоков данных для отчетности МСФО 17 Реверс-инжиниринг существующих...
- Полный день
- Опыт от 3 лет
- Москва
2 дня назад
Приглашаем в стратегический проект импортозамещения и рефакторинга большинства банковских систем. В рамках проекта происходит отказ от Oracle и перерабатываются системы процессинга и учета большинства банковских продуктов (кредиты, карты, рассрочки, ...
- Полный день
- Опыт от 3 лет
- Москва
12 дней назад
ПК «Аквариус» – ведущий российский разработчик, производитель и поставщик компьютерной техники и ИТ-решений для государственных и корпоративных заказчиков. В 2021 «Аквариус» стал 4-м в рейтинге CNews Analytics среди крупнейших российских IT-разработч...
- Полный день
- Опыт от 3 лет
- Москва
13 дней назад