GenAI Evaluation Engineer (Риски)

По договоренности


Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка.

Наша основная задача оценить флагманские генеративные модели Сбера – GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям.

Мы не просто «проверяем метрики», а:

  • глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели
  • критически рассматриваем архитектурные и методологические решения и предлагаем улучшения
  • разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска
  • проводим оценку логов пользователей для построения наиболее релевантного тестирования

Отдельный фокус – R&D деятельность:

  • создание новых методологий оценки качества
  • участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.)
  • адаптация передовых мировых бенчмарков под специфику банковских кейсов
  • и многое другое

Эта роль про независимое измерение фундаментального качества модели: не про их обучение – этим занимается отдельная команда

Обязанности

Придумывать, как вообще измерить модель

ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве.

Отвечать за достоверность измерений

Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили.

Разбираться в причинах ошибок

«Модель ошиблась» – это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация – в следующую версию модели, которая этой ошибки уже не делает.

Строить автоматическую оценку

Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей.

Строить то, чем пользуются другие

Фреймворки оценки, который вы развиваете – общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне.

Требования

  • Умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов.
  • Статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения
  • Понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация;
  • Понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения
  • Опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения
  • Продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели.
  • Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой.

Будет плюсом: R&D-опыт или участие в создании бенчмарков; мультимодальные модели (изображения, видео, аудио); evaluation-фреймворки и harness; RAG; работа с асессорами; coding-агенты (Claude Code, Codex, Cursor); опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding

Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • гибкий формат и удаленной работы, в т.ч. на территории РФ
  • ежегодный пересмотр зарплаты и годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.

Поделиться:

Опубликована 15 дней назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
В крупную российскую IT компанию, специализирующуюся на разработке программного обеспечения для моделирования ... месторождений нефти и газа требуется Cloud DevOps Engineer. ... ВМ (AWS ParallelCluster/Azure CycleCloud) Условия: Работа в динамично развивающейся аккредитованной it ...
  • Полный день
  • Опыт от 3 лет
Логотип компании Интегрированные Разработки Для МоделированияИнтегрированные Разработки Для Моделирования
  • Москва
4 дня назад
Q1X - международная IT-компания с офисами в Беларуси, России и Узбекистане. ... В связи с предстоящим расширением команды приглашаем Middle - Senior QA Automation Engineer (Java).
  • Полный день
  • Опыт от 3 лет
Логотип компании Q1XQ1X
  • Москва
7 дней назад
BIG DATA МТС – место, где телеком данные превращаются в реально работающие IT-продукты. ... Для дата-специалистов (data analyst, data engineer, data steward) мы обеспечиваем развитие и обучение ... площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации; участие во внешних IT ...
  • Полный день
  • Опыт от 3 лет
Логотип компании МТСМТС
  • Москва
18 часов назад
BIG DATA МТС – место, где телеком данные превращаются в реально работающие IT-продукты. ... Для дата-специалистов (data analyst, data engineer, data steward) мы обеспечиваем развитие и обучение ... площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации; участие во внешних IT ...
  • Полный день
  • Опыт от 3 лет
Логотип компании МТСМТС
  • Москва
18 часов назад
138 000 - 173 000 ₽
Мы в поисках QA engineer на проект по разработке программно-технических комплексов (ПТК) для управления ... Для нас важно: Наличие высшего образования в сфере инженерных специальностей, математики или IT.
  • Полный день
  • Опыт от 3 лет
Логотип компании SkillStaffSkillStaff
  • Москва
12 дней назад
Ищем ML Engineer для нашего клиента — российской IT-компании, специализирующейся на кибербезопасности ... Условия: Официальное трудоустройство, работа в аккредитованной IT-компании; Оплата питания; Доплата за ...
  • Полный день
  • Опыт от 3 лет
Логотип компании getmatchgetmatch
  • Москва
19 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.