LlmOps-DevOps

По договоренности

  • Динамо
  • Белорусская
  • Маяковская

Обязанности:

  • Готовить LLM и другие генеративные модели к промышленному запуску;

  • Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта;

  • Создавать воспроизводимые контейнерные образы и конфигурации model serving;

  • Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью;

  • Подбирать методы квантизации и оптимизации с контролем влияния на качество модели;

  • Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки;

  • Проводить профилирование, функциональные и нагрузочные тесты моделей;

  • Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища;

  • Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes;

  • Настраивать метрики, логи и трассировку model-serving-сервисов;

  • Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей;

  • Контролировать потребление GPU, утилизацию памяти и стоимость inference;

  • Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей;

  • Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры;

  • Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы;

  • Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей;

  • Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций.

Требования:

  • Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах;

  • Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса;

  • Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным;

  • Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления памятью;

  • Знание методов квантизации и их влияния на качество и производительность;

  • Практический опыт работы с GPU, CUDA и инструментами диагностики;

  • Уверенное владение Python;

  • Опыт контейнеризации с Docker и развертывания сервисов в Kubernetes;

  • Опыт проведения нагрузочных тестов и анализа latency, throughput, time to first token и inter-token latency;

  • Опыт настройки мониторинга и профилирования inference-сервисов;

  • Знание Linux, Git и основных принципов CI/CD;

  • Умение документировать эксперименты и принимать решения на основании измеримых результатов.

## Будет преимуществом

  • Опыт работы с NVIDIA GPU Operator, DCGM, MIG, NCCL и multi-node inference;
  • Знание PyTorch и Hugging Face Transformers;
  • Опыт оптимизации моделей с помощью TensorRT, ONNX или custom kernels;
  • Опыт работы с Ray Serve, KServe, Seldon или аналогичными системами;
  • Понимание особенностей MoE-моделей, speculative decoding и prefix caching;
  • Опыт построения автоматизированного контура оценки качества LLM;
  • Опыт эксплуатации моделей в on-premise или изолированных средах;
  • Опыт расчета и оптимизации unit-экономики inference.

Адрес: Россия, Москва, 2-я Звенигородская улица, 12с2
Показать на большой карте

Поделиться:

Опубликована месяц назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
Мы — сервисная DevOps-команда в подразделении SberWorks, проектирующая и обеспечивающая инфраструктуру ... Наша работа выстроена в федеративной модели: мы координируемся с другими DevOps-командами банка, участвуем ...
  • Полный день
  • Опыт от 3 лет
Логотип компании СБЕРСБЕР
  • Москва
6 дней назад
В компанию DataCatalog (Группа Arenadata) в отдел разработки требуется Devops. ... языком Python, Bash; Владеете инструментами сборки Python, Java (Maven/Gradle); Знакомы с методологией DevOps ...
  • Полный день
  • Опыт от 3 лет
Логотип компании Аренадата СофтверАренадата Софтвер
  • Москва
7 дней назад
до 250 000 ₽
Рыночная зарплата
В связи с активным ростом проектов внедрения ищем DevOps-инженера, который возьмёт на себя инфраструктурную ...
  • Полный день
  • Опыт от 3 лет
Логотип компании EnjoyproEnjoypro
  • Москва
3 дня назад
Требования Мы ждем от кандидата: высшее образование опыт работы на позиции DevOps\SRE-инженера от 2 лет ... понимание методологии DevOps, принципов CI/CD и полного жизненного цикла ПО (разработка, тестирование ... включая написание SQL-запросов и понимание административных задач навыки работы с ключевыми инструментами DevOps-стека ...
  • Полный день
  • Опыт от 3 лет
Логотип компании СБЕРСБЕР
  • Москва
4 дня назад
... дежурствах (Новогодние дежурства — добровольные) Пожелания к кандидату: Опыт от 3 лет в роли SRE / DevOps ...
  • Полный день
  • Опыт от 3 лет
Логотип компании АШАН Ритейл РоссияАШАН Ритейл Россия
  • Москва
4 дня назад
СберЛизинг – лизинговая компания экосистемы Сбера, один из лидеров рынка России. Наша команда создаёт технологичные решения, постоянно улучшает свои навыки и развивается вместе с бизнесом страны. Что мы предлагаем: конкурентный доход (оклад, годовой ...
  • Полный день
  • Опыт от 3 лет
Логотип компании СберЛизингСберЛизинг
  • Москва
7 дней назад

Похожие вакансии

Логотип компании СБЕРСБЕР
Логотип компании Аренадата СофтверАренадата Софтвер
до 250 000 ₽
Логотип компании EnjoyproEnjoypro
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.