MLOps Engineer (Devops)

По договоренности


Направление работы:

ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс – порядка 400–500K RPS, десятки инстансов Triton.

Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем – строим общую мультитенантную ML-платформу для всего отдела.

Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.

Стань частью команды!

Вам предстоит:

  • Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;

  • Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;

  • Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;

  • Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;

  • Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);

  • Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;

  • Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.

Формат работы - гибридный или удаленный по договоренности с руководителем.

Вы нам подходите, если:

  • Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);

  • Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;

  • Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги);

  • Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm;

  • Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг;

  • Умеете взаимодействовать с DS-командами и переводить потребности в технические решения;

Будет плюсом:

  • Опыт с Triton Inference Server, vLLM, KServe или аналогами;

  • Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений;

  • Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus);

  • Сторадж под данные обучения: S3, Ceph, NFS;

  • Multi-node training: NCCL, InfiniBand, RDMA.


Поделиться:

Опубликована 4 дня назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
от 300 000 ₽
Выше средней на 27%
... DevOps инженер: создавай инфраструктуру будущего вместе с нами! ... инциденты Взаимодействие с командами разработки и эксплуатации Оптимизация процессов и внедрение новых DevOps-практик ... Требования: Опыт работы DevOps-инженером от 3 лет Глубокие знания CI/CD (Jenkins, GitLab CI, TeamCity ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Андрианов Кирилл ВладимировичАндрианов Кирилл Владимирович
  • Москва
18 часов назад
Мы хотим усилить нашу команду, поэтому в поисках DevOps-инженера, который помог бы нам сопровождать платформы ... Чем предстоит заниматься: поддерживать архитектуру DevOps решений у крупных корпоративных заказчиков, ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Инфосистемы ДжетИнфосистемы Джет
  • Москва
2 дня назад
ПРОЕКТ: в банковской сфере по импортозамещению. ЧТО МЫ ОЖИДАЕМ ОТ КАНДИДАТА: Высшее техническое образование; Опыт в банковской сфере; Опыт работы с любой из систем Continuous Integration (Jenkins, TeamCity, Bamboo & etc); Опыт работы с любой из с...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Bell IntegratorBell Integrator
  • Москва
2 дня назад
до 250 000 ₽
Выше средней на 6%
Сейчас у нас открыта вакансия DevOps на проект в крупный Российский банк. ... telemetry; Docker: писать Dockerfile под конкретное приложение Необходимые знания и навыки: Опыт работы DevOps ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании DatanomicaDatanomica
  • Москва
4 дня назад
Мы ищем коммуникабельного и самостоятельного DevOps-инженера Чем предстоит заниматься: Автоматизировать ... Мы ожидаем что у вас есть: Опыт работы DevOps-инженером от 5 лет в проектах веб-разработки и высоконагруженных ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Ригла-ЗдравситиРигла-Здравсити
  • Москва
4 дня назад
от 240 000 ₽
Рыночная зарплата
Кого мы ищем Мы ищем DevOps-инженера, который уверенно работает с Linux, Kubernetes и CI/CD и хочет отвечать ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании JapanStatJapanStat
  • Москва
6 дней назад

Похожие вакансии

от 300 000 ₽
Логотип компании Андрианов Кирилл ВладимировичАндрианов Кирилл Владимирович
Логотип компании Инфосистемы ДжетИнфосистемы Джет
Логотип компании Bell IntegratorBell Integrator
до 250 000 ₽
Логотип компании DatanomicaDatanomica
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.