NLP engineer (GigaChat Pretrain Data)
По договоренности
Мы - команда GigaChat Pretrain Data, готовим pretrain данные для GigaChat и GigaChat Vision. Pretrain данные - это фундамент, с которого начинается путь современной LLM модели и то, от чего наиболее зависит ее итоговое качество. Сырых данных более 40Пб и основная задача заключается в том, чтобы из этого хаоса сделать датасет, на котором будет обучена лучшая LLM в России.
Обязанности
- генерировать синтетические данные: математика, код, произвольная синтетика с сидами - документами из Web
- исследовать токенизацию и ее влияния на качество модели (возможно написание статей)
- решать задачи кластеризации миллиардов документов
- исследовать разные факторы, которыми обладают текстовые данные
- генерировать Vision данные для прокачки VLM
- разрабатывать новые алгоритмы парсинга HTML и исследовать его влияние на качество модели
- исследовать зависимости между pretrain данными и agentic capabilities итоговой модели
- разрабатывать стабильную инфраструктуру, которая будет поддерживать проведение сотен и тысяч экспериментов над данными.
Требования
- имеешь коммерческий релевантный опыт связанный с NLP или построением инфраструктуры для данных от двух лет.
Будет плюсом
- навыки работы с генеративными AI-моделями; опыт создания AI-агентов и использования их в работе будет преимуществом
- опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов
- инструментальное владение AI для анализа, генерации и автоматизации.
- диплом ШАД/ ВШЭ Факультета компьютерных наук/ МФТИ школы прикладной математики и информатики и/или есть опыт с MapReduce системами, например, YT.
Условия
- комфортный современный офис рядом с м. Кутузовская
- гибридный формат работы (2 дня в офисе, 3 дня на удалёнке)
- ежегодный пересмотр зарплаты, годовая премия
- корпоративный спортзал и зоны отдыха
- система обучения для профессионального и карьерного развития
- расширенный полис ДМС с первого дня работы и страхование для семьи
- льготная программа ипотеки для сотрудников
- бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера.
Опубликована 20 дней назад
Похожие вакансии
Мы расширяем команду и ищем опытного Специалист технической поддержки / IT Support Engineer (L1–L2) Что ...
- Полный день
- Опыт от 3 лет
- Москва
22 дня назад
до 240 000 ₽
Выше средней на 26%
... -10 крупнейших IT-компаний России. ... В связи с активным развитием проектов в компании открыта вакансия Data Engineer. ... НАШИ ОЖИДАНИЯ ОТ УСПЕШНОГО КАНДИДАТА: Опыт работы в роли data engineer ≈ 5 лет (Обязательно); Опыт работы ...
- Полный день
- Опыт от 3 лет
- Москва
4 часа назад
Johnson &Johnson is looking for a talented Reliability Engineer to join our Russia-based IT organization ... Reliability Engineer will be responsible for ensuring the reliability, availability, and performance ... Proven experience as a Reliability Engineer, Site Reliability Engineer, or similar role supporting enterprise-scale ...
- Полный день
- Опыт от 3 лет
- Москва
4 дня назад
Она образована в результате слияния двух лидеров рынка — IT-компании Wildberries и оператора наружной ... Wildberries и Russ — это лидер рынков e-commerce и наружной рекламы в России с современной IT-инфраструктурой ... Направление работы: Сейчас мы ищем опытного QA Engineer в нашу команду инфраструктурной разработки.
- Полный день
- Опыт от 3 лет
- Москва
день назад
Активно действует на рынке IT России с 1997 года, входит в ТОП-400 крупнейших российских компаний, ТОП ... -10 крупнейших IT-компаний России. ... В связи с активным развитием проектов в компании открыта вакансия DATA ENGINEER в офис в Москве.
- Полный день
- Опыт от 3 лет
- Москва
2 дня назад
Международная IT-компания, специализирующаяся на создании высоконагруженных онлайн-сервисов ищет в команду ... Кого ищем: Опыт работы в роли DWH Developer / Data Engineer / Database Developer от 3х лет.
- Полный день
- Опыт от 3 лет
- Москва
4 дня назад
Вакансия в подборках
Похожие вакансии
до 240 000 ₽