Data Engineer
По договоренности
Команда блока Строительства в поиске Data Engineer на задачи по построению хранилища и автоматизации работы бизнес процессов.
Обязанности
- Подготовка данных для AI: Формирование датасетов для обучения ML-моделей и тонкой настройки LLM-агентов (очистка, разметка, агрегация);
- Разработка пайплайнов: Создание и сопровождение ETL-процессов, агрегирующих информацию из 3 смежных автоматизированных систем (АС), с обеспечением минимальной задержки;
- Векторные хранилища: Проектирование схем и наполнение векторных баз данных (Chroma, Qdrant, Milvus) для реализации семантического поиска и RAG-архитектур;
- Управление качеством данных (Data Quality): Внедрение систем валидации (проверка на полноту, дубликаты, аномалии) и мониторинг показателей здоровья данных;
- Data Lineage & Документация: Ведение полного учета происхождения данных (от источника до агента), разработка схем данных и актуализация технической документации для смежных команд (ML-инженеров и бэкендеров).
Требования
- Опыт работы: От 3 лет в коммерческой разработке на позиции Data Engineer или ETL-разработчика;
- Языки и стек: Продвинутое владение Python (написание продакшн-кода) и SQL (сложные запросы, оконные функции);
- Распределенная обработка: Уверенное владение Apache Spark (PySpark) для трансформации больших объемов данных;
- Оркестрация: Построение и поддержка ETL/ELT-пайплайнов с использованием Apache Airflow или Apache NiFi;
- Хранилища данных: Практический опыт с колоночными СУБД (ClickHouse) и/или облачными решениями типа Snowflake;
- Интеграции: Опыт проектирования REST API для выдачи данных наружу (в том числе для агентов);
- Работа с "грязными" форматами: Умение парсить, нормализовать и структурировать неструктурированные данные (опыт работы с PDF-документами, чертежами DWG, сканами) обязателен;
- Инструментальное владение AI для анализа, генерации и автоматизации.
Условия
- Гибридный формат работы (современный офис в Москве на метро Кутузовская);
- Льготные ипотечные условия кредитования;
- Подписка Прайм с возможностью совместного использования на трёх близких;
- Скидки на продукты компаний – партнеров: Okko, Сбер Маркет, Мега Маркет, Самокат, Еаптека и другие;
- ДМС с первого дня и скидки на страхование для близких;
- Корпоративная пенсионная программа;
- Детский отдых и подарки за счет Компании;
- Обучение за счет Компании, Онлайн курсы, неограниченный доступ к библиотеке и обучение на базе Корпоративного университета, тренинги, митапы и возможность получить новую квалификации.
Опубликована 21 час назад
Похожие вакансии
Вакансии быстро закрываются — подпишитесь на наш канал в MAX сейчас, чтобы видеть их первыми.
Подписаться в MAXНАШ СТЕК: Hadoop, GreenPlum, S3; Airflow, Spark, Kafka, Debezium; ClickHouse, Superset; ЧТО ТЕБЯ ЖДЕТ: Анализ имеющегося функционала хранилища данных для целей миграции бизнес-процессов; Анализ новых требований от заказчиков по задачам развития отчет...
- Полный день
- Опыт от 3 лет
- Москва
3 дня назад
ИЩЕМ ТИММЕЙТА В КОМАНДУ УПРАВЛЕНИЯ ДАННЫМИ Ты будешь отвечать за проектирование и развитие отказоустойчивых пайплайнов потоковой обработки данных, влияя на скорость и качество решений внутренних команд. С тебя — самостоятельность, инженерная глубина ...
- Полный день
- Опыт от 3 лет
- Москва
3 дня назад
В связи с расширением проектов у нас открыта вакансия DATA ENGINEER. ... СТЕК: SQL, Hadoop, Hive, Spark, Python ОТ УСПЕШНОГО КАНДИДАТА МЫ ОЖИДАЕМ : Опыт в роли Data Engineer ...
- Полный день
- Опыт от 3 лет
- Москва
4 дня назад
... оркестраторами ETL процессов владение SQL на уровне native speaker уверенное знание Python опыт работы с Big Data ...
- Полный день
- Опыт от 3 лет
- Москва
2 дня назад
от 250 000 ₽
Выше средней на 13%
Обязанности: • Построение платформы для мониторинга сайтов поднадзорных, а также написание скриптов для этой платформы• Написание и доработка скриптов для решения типовых надзорных задач • Подготовка данных для BI-аналитики • Взаимодействие с другими...
- Полный день
- Опыт от 3 лет
- Москва
6 дней назад