Senior LLM Inference Backend Engineer
По договоренности
О команде:
Наша команда обеспечивает доступность нейросетей для тысяч пользователей одновременно. Мы сопровождаем и улучшаем production-платформу для хостинга LLM: ее надежность, производительность и масштабирование. Кроме того, мы создаём прикладные AI-продукты на базе LLM. Ищем опытного инженера, которому интересно работать и с платформенной частью, и с продуктовой.
Чем предстоит заниматься:
- Инфраструктура и высоконагруженный инференс (Platform Engineering):
- Проектирование и поддержка GPU-кластера инференса (Nvidia) для десятков тысяч пользователей: скалирование, балансировка и приоритизация запросов, пользовательские лимиты;
- Оптимизация производительности: кэширование, батчинг, etc.;
- Надежность и observability: обеспечение SLA и предотвращение регрессий;
- Оценка и внедрение новых LLM.
- Продуктовая разработка (LLM Application):
- Разработка AI-сервисов: AI Code Assistant (Co-Pilot), AI Chat, AI Code Review;
- Проектирование пайплайнов автоматизаций: tool/function calling, обработка ошибок, управление контекстом/состоянием;
- Интеграции: встраивание AI-сервисов в корпоративную среду (API, БД, legacy-системы).
- Исследования и прототипирование (R&D):
- Проведение экспериментов, создание MVP и выстраивание пути доведения до продакшена;
- Исследование новых технологий и подходов для улучшения продуктов.
Мы ждем от будущего члена команды:
- Экспертиза в Python & Backend:
- Опыт разработки на Python (5+ лет), знание стандартов: typing, асинхронность, паттерны проектирования;
- Опыт создания высоконагруженных API (FastAPI или аналоги), работа с очередями, воркерами и фоновыми задачами.
- Архитектура и надежность (Production):
- Опыт построения gateway/router, управление ключами, маршрутизация, пользовательские лимиты;
- Опыт поддержки высоконагруженных сервисов в продакшене: стабильность контрактов, обработка ошибок.
- Глубокие знания LLM & Inference:
- Опыт работы с инструментами инференса (vLLM, SGLang, OpenAI API), понимание их внутренней работы;
- Опыт настройки инференса под highload: latency/throughput, управление GPU-ресурсами;
- Опыт построения решений с tool/function calling: MCP, guardrails, борьба с галлюцинациями.
Дополнительно приветствуем:
- Насмотренность в применении AI агентов, мультиагентных систем, оркестрации инструментов;
- Понимание основных метрик качества LLM решений, опыт проведения A/B-тестов и офлайн-оценки: eval-сеты, human eval, etc;
- Опыт Lua-разработки;
- Опыт разработки и интеграции MCP.
Адрес: Россия, Москва, Рочдельская улица, 15с1
Опубликована 2 месяца назад
Похожие вакансии
Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатноАктивно действует на рынке IT России с 1997 года, входит в ТОП-400 крупнейших российских компаний, ТОП ... -10 крупнейших IT-компаний России. ... В связи с активным развитием проектов в компании открыта вакансия Data Engineer.
- Можно удаленно
- Полный день
- Опыт от 3 лет
- Москва
4 дня назад
Ищем QA Engineer, который будет отвечать за качество разрабатываемых модельных и AI-сервисов для банковского ... Что важно: Опыт работы QA Engineer от 2 лет; Опыт работы с Jira / Confluence или аналогами; Опыт работы ... с Test IT или аналогичными системами управления тестированием; Опыт тестирования REST API; Уверенное ...
- Можно удаленно
- Полный день
- Опыт от 3 лет
- Москва
7 дней назад
Активно действует на рынке IT России с 1997 года, входит в ТОП-400 крупнейших российских компаний, ТОП ... -10 крупнейших IT-компаний России. ... В связи с активным развитием проектов в компании открыта вакансия Data Engineer.
- Можно удаленно
- Полный день
- Опыт от 3 лет
- Москва
4 дня назад
Aston — аккредитованная аутсорсинговая IT-компания, работающая с 2007 года. ... Предлагаем присоединиться в роли BI Engineer и работать над проектом заказчика. ... Ершова, 76/1), Самара (IT парк Монте Роза).
- Можно удаленно
- Полный день
- Опыт от 3 лет
- Москва
20 дней назад
Сейчас мы в поисках DevOps Platform Engineer. ... Мы ищем человека, у которого есть: От 4-х лет на позициях DevOps-инженера, SRE (Site Reliability Engineer ... БЦ Омега Плаза); Компенсация 50% оплаты парковки на территории БЦ; Трудоустройство в аккредитованной IT-компании ...
- Можно удаленно
- Полный день
- Опыт от 3 лет
- Москва
месяц назад
Мы ищем AI/ML Engineer в команду разработки агентных решений для крупной зарубежной цифровой экосистемы ... Мясницкая, 16); Официальное трудоустройство в соответствии с ТК РФ в аккредитованную IT-компанию; ДМС ...
- Можно удаленно
- Полный день
- Опыт от 3 лет
- Москва
3 дня назад