ML-инженер (Online RL) / Post-Training LLM

По договоренности


Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.


Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат

Обязанности


Разрабатывать и улучшать методы online RL


Реализовывать и дорабатывать подходы post-training и online RL.


Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.


Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.


Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.


Строить и развивать инфраструктуру обучения


Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.


Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.


Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.


Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.


Работать с данными и системой оценки качества


Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.


Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.


Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения.


Работать в сильной команде


Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры.


Брать на себя ответственность за целые куски системы: от идеи до результата в проде.


Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.

Требования


Отличное владение Python и PyTorch.


Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.


Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.


Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.


Умение писать чистый, надёжный, production-ready код.


Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.


Будет плюсом


Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.


Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.


Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).


Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).


Публикации, open-source вклад или сильный прикладной track record.

Условия


Сильные и сложные задачи на переднем крае развития русскоязычных LLM.


Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте.


Команду сильных инженеров и исследователей, у которых есть чему поучиться.


Возможность совмещать инженерную и исследовательскую работу.


Конкурентную компенсацию, премии и расширенный соцпакет.


Поделиться:

Опубликована 4 дня назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
от 138 000 ₽
Обязанности: Ремонт и проведение ТО электрики, сантехники, общестроительных ремонтных работ, кухонного оборудования и пр. в новом ресторанном проекте Требования: Техническое образование Профильный опыт работы Условия: Оформление по ТК РФ (полностью «...
  • Полный день
  • Опыт от 3 лет
Логотип компании Группа ГутаГруппа Гута
  • Москва
4 дня назад
В связи с активным развитием компании мы ищем в нашу команду Инженера ТО слаботочных систем.
  • Полный день
  • Опыт от 3 лет
Логотип компании Indecom GroupIndecom Group
  • Москва
19 дней назад
... планирование текущих и капитальных ремонтов; взаимодействие с представителями Службы эксплуатации БЦ (Главный инженер ... , Главный энергетик, Инженер ОВиК, Диспетчерская служба); взаимодействие с подрядными организациями, ... Требования: Иметь высшее профессиональное (техническое) образование и стаж работы в должности инженера ...
  • Полный день
  • Опыт от 3 лет
Логотип компании ФК Гранд КапиталФК Гранд Капитал
  • Москва
5 дней назад
150 000 - 200 000 ₽
Рыночная зарплата
Выполнять профилактические работы по графику ТО/ППР, который составляет Главный инженер. ... Как организована работа: за каждым инженером закреплены объекты. ... самостоятельно не удаётся, обращается к Главному инженеру.
  • Полный день
  • Опыт от 3 лет
Логотип компании 1ГК1ГК
  • Москва
5 дней назад
В крупной международной горнодобывающей компании открыта вакансия Инженер по планированию ТО и Ремонта ...
  • Полный день
  • Опыт от 3 лет
Логотип компании МПШ Восток | MPH VostokМПШ Восток | MPH Vostok
  • Москва
4 дня назад
150 000 - 200 000 ₽
Рыночная зарплата
... Инженер ПТО в Crocus Group — это ключевая роль в обеспечении качества и соответствия нормам наших проектов ...
  • Полный день
  • Опыт от 3 лет
Логотип компании Crocus GroupCrocus Group
  • Москва
5 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.