Data Engineer (Центр робототехники)

По договоренности


В Центре робототехники Сбера мы создаем роботов и системы ИИ, которым нужны большие и аккуратно подготовленные наборы данных. Data Conveyor Team отвечает за путь этих данных от сырых записей до формата, с которым могут работать ML-команды. Сейчас нам нужен Software Engineer, который будет превращать записи с роботов и внешние датасеты в понятный, проверяемый и воспроизводимый формат для обучения моделей.

Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него, диалог займёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!

Обязанности

  • проектировать и реализовывать пайплайны, которые превращают данные из разных источников в формат, пригодный для обучения моделей
  • стабилизировать основной путь конвертации данных с роботов: единый поддерживаемый процесс, проверяемые результаты, повторяемые запуски и понятные отчеты об ошибках
  • поддерживать dataset schema, versioning, compatibility checks, validators и manifests
  • подключать новые источники данных: записи с роботов, внешние датасеты, симуляции, egocentric data, данные тестовых запусков и корректирующих демонстраций
  • обеспечивать reproducible dataset builds и связь source data -> converted episodes -> filtered dataset -> dataset release -> training run -> benchmark result
  • создавать validation suite: проверка файлов, video/parquet layout, timestamps, required fields, metadata, annotation status и known historical variants
  • готовить данные к передаче в обучение так, чтобы ML-команды понимали состав датасета, ограничения, версию и качество
  • делать надежные CLI/tools, тесты, runbooks и отладочные отчеты для исследователей и инженеров.

Требования

  • сильный Python и опыт разработки batch / data processing pipelines
  • опыт backend, data engineering или software engineering для внутренних платформ и ML/data workflows
  • опыт работы с большими файлами, metadata manifests, reproducible builds и validation logic
  • практический опыт с Linux, Docker, Git, CI/CD и командной строкой
  • понимание storage и data formats: S3/object storage, network storage, parquet, zarr, hdf5, webdataset, video files или аналогичные форматы
  • умение разбираться в нестандартных форматах данных и приводить их к строгому контракту
  • готовность писать поддерживаемый production-like код, а не одноразовые conversion scripts.

Будет плюсом:

  • опыт с LeRobot, RLDS, DROID / Bridge / RT-X-like datasets, ROS bags или robotics trajectories
  • опыт с Ray, Airflow, Prefect, Kubernetes, SLURM, LSF или другими orchestration / job systems
  • опыт с W&B, MLflow, Hydra configs, experiment tracking или dataset management systems
  • понимание computer vision, multimodal data, VLA, imitation learning или robot learning
  • навыки работы с генеративными AI-моделями
  • опыт создания AI-агентов и использования их в работе будет преимуществом
  • опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов
  • инструментальное владение AI для анализа, генерации и автоматизации.

Условия

  • офисный формат работы, адрес офиса Автозаводская 23а к2
  • ежегодный пересмотр зарплаты, квартальная и годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • программа адаптации и помощь руководителя на старте
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбера.

Поделиться:

Опубликована 9 дней назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
Наша работа — это фундамент, на котором аналитики и data scientists строят свои модели и принимают ключевые ... Требования опыт работы: не менее 2 лет в качестве Data Engineer / ETL Developer python: написание дагов ...
  • Полный день
  • Опыт от 3 лет
Логотип компании СБЕРСБЕР
  • Москва
2 дня назад
Cтек технологий Big Data (Hadoop, Spark, Hive/Impala) и любой СУБД.
  • Полный день
  • Опыт от 3 лет
Логотип компании Bell IntegratorBell Integrator
  • Москва
4 дня назад
от 280 000 ₽
Выше средней на 21%
Сейчас в нашей команде открыта позиция Data Engineer. ... Проектирование архитектуры данных в Data Lake и Data LakeHouse. ... Требования: 3+ лет опыта в области Data Engineering, Data Governance, Data Quality или Data Platform.
  • Полный день
  • Опыт от 3 лет
Логотип компании Digital ChiefDigital Chief
  • Москва
4 дня назад
Мы ищем талантливого Data Engineer, который готов столкнуться с непростыми задачами в области хранения ... опыт разработки и сопровождения пайплайнов данных Опыт работы с PySpark, Python и SQL Опыт работы с Data ... данных Будет плюсом: Опыт работы с Trino+S3 Опыт оркестрации пайплайнов с помощью Airflow Знакомство с Data ...
  • Полный день
  • Опыт от 3 лет
Логотип компании Московский метрополитенМосковский метрополитен
  • Москва
5 дней назад
до 295 000 ₽
Выше средней на 28%
Cтек технологий Big Data (Hadoop, Spark, Hive/Impala) и любой СУБД.
  • Полный день
  • Опыт от 3 лет
Логотип компании Bell IntegratorBell Integrator
  • Москва
5 дней назад
... изучению) опыт с Hadoop (HDFS, YARN, Hive) знание облачных платформ (AWS S3/Glue, GCP BigQuery, Azure Data ...
  • Полный день
  • Опыт от 3 лет
Логотип компании СБЕРСБЕР
  • Москва
6 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.