Tech Lead MLOps

По договоренности


Мы строим современную платформу данных и ML: хранилище по слоям, единый профиль клиента (MDM), фичестор и систему принятия решений по заявкам в реальном времени.

ML-инфраструктуры в полноценном виде у нас пока нет, и мы ищем человека, который спроектирует её сам: выберет подходы и инструменты, обоснует решения, реализует и станет владельцем платформы. Это не позиция «делать по готовому ТЗ».

Важно: это роль технического лидера, а не менеджера. Основную часть времени вы будете сами, своими руками разворачивать, настраивать и отлаживать инфраструктуру — от кластеров и сервисов до CI/CD, логирования и алертов.

Чем предстоит заниматься:

  • Спроектировать целевую архитектуру ML-платформы: как модели обучаются, выкатываются, обслуживаются и мониторятся; как фичи попадают из DWH в онлайн-контур скоринга.
  • Сравнивать и выбирать технологии под наши задачи, готовить обоснования и защищать решения перед командой и руководством.
  • Своими руками развернуть и настроить: dbt поверх Greenplum, Yandex Data Proc (Spark), MLflow (трекинг экспериментов, реестр моделей), serving моделей (онлайн-инференс по API и батч-скоринг, версионирование, откаты).
  • Развернуть, настроить и поддерживать инфраструктуру фичестора на Feast: офлайн-хранилище в DWH (Greenplum), онлайн-хранилище на Valkey, registry, materialization, логирование и мониторинг. Сами признаки и пайплайны строят дата-инженеры, а вы задаёте стандарты работы с фичестором (регистрация фич, point-in-time корректность, отсутствие расхождений train/serve), обучаете команду и ревьюите решения.
  • Выстроить мониторинг на всех уровнях: инфраструктура и сервисы — метрики, логи, алертинг (Prometheus, Grafana, Alertmanager, ELK/Loki); модели — дрейф фич и скоров, стабильность (PSI), деградация качества, латентность и ошибки инференса; данные — свежесть, полнота и корректность фич и витрин, контроль пайплайнов Airflow и dbt; дашборды и регламенты реагирования на инциденты.
  • Обеспечить онлайн-скоринг заявки с низкой задержкой: сбор фич из фичестора, MDM и внешних источников.
  • Автоматизировать пайплайны (Airflow, Kafka, Debezium), выстроить инфраструктуру как код (Terraform) и CI/CD.
  • Поддерживать всё развёрнутое в эксплуатации: обновления, масштабирование, разбор инцидентов, runbook-и.
  • Самостоятельно находить узкие места и риски в платформе и предлагать, что улучшить, не дожидаясь запроса.
  • Задавать стандарты MLOps/DataOps и помогать командам DWH и Data Science работать по ним.

Что мы ждём:

  • От 5 лет в DevOps / Data Engineering / MLOps, из них от 2 лет — ML-инфраструктура в продакшене.
  • Сильный hands-on опыт: вы сами разворачивали и эксплуатировали инфраструктуру в проде и готовы много работать руками — Kubernetes, Terraform, конфиги, пайплайны, отладка.
  • Опыт проектирования платформы или крупной подсистемы с нуля — не только поддержки существующей. Готовность рассказать, какие решения принимали и почему.
  • Архитектурное мышление: умение видеть систему целиком, учитывать нагрузку, отказоустойчивость, стоимость владения и безопасность, взвешивать компромиссы.
  • Опыт вывода ML-моделей в прод с онлайн-инференсом (FastAPI, BentoML, KServe, Triton или аналоги).
  • Уверенный Python, SQL, Linux, Git.
  • MLflow (или аналоги), Airflow, Spark, Kafka.
  • Docker, Kubernetes, CI/CD, Terraform.
  • dbt и MPP-хранилища (Greenplum, PostgreSQL, ClickHouse), + Redis.
  • Опыт развёртывания и эксплуатации Feast в проде: online/offline store, registry, materialization, point-in-time корректность, интеграция с сервисом инференса. Умение передать эти знания дата-инженерам: написать гайдлайны, провести ревью, разобрать ошибки.
  • Опыт построения мониторинга с нуля: Prometheus, Grafana, алертинг; мониторинг ML-моделей (Evidently, NannyML или собственные решения); контроль качества данных (dbt tests, Great Expectations или аналоги).
  • Проактивность: вы сами формулируете задачи, доводите их до результата и приходите с предложениями, а не ждёте постановки.
  • Умение письменно оформлять архитектурные решения (ADR, схемы, документация) и объяснять их техническим и нетехническим коллегам.

Будет плюсом:

  • Опыт в Yandex Cloud (Data Proc, Managed Kubernetes, Managed Greenplum / MPP Analytics).
  • Опыт в финтехе, банках или МФО: кредитный скоринг, антифрод, работа с БКИ.
  • Знание требований 152-ФЗ и практик работы с персональными данными.
  • Опыт с потоковой обработкой (Flink, Spark Structured Streaming).

Мы предлагаем:

  • Возможность построить ML-платформу с нуля и влиять на архитектуру.
  • Современный стек и реальные задачи с измеримым влиянием на бизнес.
  • Зарплата: обсуждается по итогам интервью.
  • Формат работы: удобный для вас [удалённо / гибрид / офис в Москве].
  • Скидки от компаний-партнеров через PrimeZone.

Поделиться:

Опубликована 7 часов назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
Команда «ДОРА» разрабатывает несколько сервисов: сервис генерации документов (цель - повысить скорость и качество подготовки документов за счет автоматизации и использования LLM модели), сервис саммаризации документов (позволяет автоматически преобра...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании РСХБ-ИнтехРСХБ-Интех
  • Москва
3 дня назад
Мы создаём технологию восстановления конструкторской документации по старым архивным чертежам. На входе — комплект отсканированных документов: чертежи деталей и сборок, спецификации, электрические схемы, технические требования и рукописные изменения....
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании АстрАстр
  • Москва
5 дней назад
Сейчас мы ищем Graphics Tech Lead — Технического Лидера графического направления, который будет отвечать ... систем на всех этапах жизненного цикла проекта, включая продакшен Взаимодействие с командами Engine, Tech ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании MadOut GamesMadOut Games
  • Москва
13 дней назад
... в найме, развитии специалистов и построении структуры отдела Наши ожидания: Опыт работы на позиции Tech ... Lead / CTO в арбитраже критически важно Опыт управления технической командой и реализации сложных инфраструктурных ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании RMRM
  • Москва
2 месяца назад
Приглашает в команду Технического директора СТО / Tech Lead of E-commerce / Менеджера продукта Задачи ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Glow MeGlow Me
  • Москва
5 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.