Руководитель направления Pretrain Efficiency

По договоренности


Мы развиваем GigaChat и ищем сильного руководителя направления RL Efficiency. Это роль для человека, который возьмёт на себя эффективность всего RL-контура: обучающий цикл, rollout, reward-сигналы, взаимодействие с инференсом и инфраструктура под онлайн-эксперименты.

Цель направления — сделать так, чтобы online RL / RLHF / RLVR обучение GigaChat было максимально быстрым, стабильным и дешёвым: сократить time-to-feedback по экспериментам, поднять утилизацию кластера и упростить запуск новых RL-рецептов на масштабе.

Обязанности

Развивать направление RL Efficiency целиком

• Определять, как должно развиваться направление эффективности RL: какие места критичны на данный момент, как измерять прогресс и что в первую очередь ограничивает скорость экспериментов.

• Вести направление целиком: от постановки гипотез и плана работ до внедрения результатов в регулярный цикл обучения.

• Принимать решения о приоритетах между ускорением rollout, оптимизацией обучающего цикла, инфраструктурой и системой оценки качества.

Ускорять цикл online RL

• Оптимизировать пайплайн online RL: генерация rollout'ов, сбор reward-сигналов, обновление весов модели, overlap этапов.

• Выстраивать эффективное взаимодействие между обучающим контуром и инференс-движком (vLLM / SGLang / собственные решения), добиваясь высокой утилизации и низкой задержки.

• Работать с весами и KV-cache: быстрое обновление весов между итерациями, снижение overhead синхронизаций, оптимизация памяти.

• Повышать стабильность больших RL-прогонов: контроль деградаций, автоматическое восстановление, диагностика сбоев.

Развивать инфраструктуру под RL-эксперименты

• Развивать фреймворк обучения, поддерживающий RLHF / RLVR / PPO / GRPO / DPO и их вариации на масштабе.

• Делать так, чтобы новые RL-рецепты можно было быстро и безопасно запускать на больших моделях без ручной поддержки для каждого эксперимента.

• Обеспечивать воспроизводимость RL-экспериментов: версионирование данных, конфигов, чекпоинтов, reward-моделей.

Писать ключевой код и оставаться сильным инженером

• Самостоятельно писать и дорабатывать критичные части RL-пайплайна.

• Профилировать обучение на всех уровнях стека и находить узкие места в rollout, обучении и коммуникациях.

• Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и взаимодействии с hardware.

Руководить сильной технической командой

• Руководить командой инженеров по эффективности RL, задавать высокую планку по качеству решений и перфу.

• Помогать команде превращать исследовательские идеи в работающие решения, которые можно встроить в основной цикл RL-обучения.

• Удерживать баланс между глубиной оптимизаций, инженерной надёжностью и практическим результатом для модели.

Требования

• Отличное владение Python и PyTorch (DDP/FSDP, distributed training).

• Практический опыт с обучением LLM и понимание механики RL post-training: RLHF, RLVR, PPO / GRPO / DPO.

• Опыт оптимизации обучения и инференса LLM: профилирование, узкие места, параллелизм, mixed precision.

• Понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), MoE и их влияние на rollout.

• Способность самостоятельно взять направление и довести его до результата: от постановки задач до внедрения в продакшн-RL.

• Опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

Будет плюсом

• Опыт работы с современными RL-стэками: verl, TRL или собственные решения.

• Опыт работы с large-scale inference (vLLM, SGLang, TRT-LLM) и оптимизацией генерации.

• Опыт написания CUDA / Triton ядер и понимание особенностей NVIDIA GPU.

• Понимание коммуникационного стека больших обучений: NCCL, NVSHMEM, RDMA/IB.

• Опыт работы с кластерными системами: Slurm, Kubernetes, Ray или собственные оркестраторы.

• Публикации, open-source вклад или сильный прикладной research track record.

Условия

• Сильные и сложные задачи на переднем крае развития русскоязычных LLM.

• Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.

• Команду сильных инженеров и исследователей.

• Возможность совмещать управление направлением с глубокой технической работой.

• Конкурентную компенсацию, премии и расширенный соцпакет.


Поделиться:

Опубликована 2 дня назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
Требования: Высшее образование (Не ниже уровня магистра / специалиста по направлению экономика / статистика ...
  • Полный день
  • Опыт от 1 года
Логотип компании Почта РоссииПочта России
  • Москва
10 дней назад
В связи с активным ростом компании приглашаем на работу Руководителя товарного направления Лакокрасочные ... Опыт работы на рынке по данным направлениям не менее 1 года; Опыт прямых продаж от 2х лет; Умение управлять ...
  • Полный день
  • Опыт от 1 года
Логотип компании САТУРН ЦЕНТРСАТУРН ЦЕНТР
  • Москва
2 дня назад
Подразделение Нетканые материалы объявляет конкурс на вакансию Руководитель направления «Геосинтетики ... геотекстиль,георешетки, геосетки и их композиции на объектах ТДС в регионах совместно с региональными руководителями ...
  • Полный день
  • Опыт от 1 года
Логотип компании ТЕХНОНИКОЛЬТЕХНОНИКОЛЬ
  • Москва
6 дней назад
Ищем руководителя направления Центра финансового моделирования для формирования статистической и иной ...
  • Полный день
  • Опыт от 1 года
Логотип компании Азиатско-Тихоокеанский БанкАзиатско-Тихоокеанский Банк
  • Москва
2 дня назад
... подразделений банка; Опыт координации работ с большим количеством сотрудников организации из разных направлений ...
  • Полный день
  • Опыт от 1 года
Логотип компании Азиатско-Тихоокеанский БанкАзиатско-Тихоокеанский Банк
  • Москва
5 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.