Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)

По договоренности


2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей.

Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.

Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.

Чем предстоит заниматься

Развивать Incident & Problem Management

  • внедрять и развивать единый процесс управления инцидентами;
  • формировать культуру postmortem-разборов без поиска виноватых;
  • контролировать выполнение action items, направленных на предотвращение повторных сбоев;
  • улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования.

Развивать observability

  • стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов;
  • участвовать в создании единой платформы мониторинга и визуализации;
  • разрабатывать стандарты логирования;
  • контролировать объём и качество данных, поступающих в системы телеметрии.

Трансформировать подход к алертингу

  • проводить аудит существующих алертов и снижать число ложных срабатываний;
  • формировать единые принципы приоритизации алертов с учётом критичности сервисов;
  • помогать командам настраивать полезные, своевременные и понятные уведомления.

Внедрять SRE-практики и повышать зрелость команд

  • участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP;
  • помогать командам определять и внедрять SLO/SLA;
  • создавать дашборды для контроля Error Budget;
  • разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов;
  • консультировать продуктовые команды по вопросам стабильности и надёжности.

Автоматизировать процессы

  • формировать требования к развитию платформы дежурств и интеллектуальной эскалации;
  • внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков.

Мы ожидаем, что ты

  • Работаешь в SRE или DevOps от 3 лет.
  • Хорошо понимаешь принципы SRE: SLO, SLA, Error Budget, Incident Management и Observability.
  • Имеешь практический опыт работы с системами мониторинга и алертинга — например, Prometheus и Grafana.
  • Работал с OpenTelemetry или аналогичными инструментами.
  • Автоматизируешь процессы на Python, Go, Bash или другом языке.
  • Понимаешь принципы работы on-call-ротаций и систем управления инцидентами.
  • Умеешь анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения.
  • Знаком с CI/CD, Kubernetes и контейнеризацией.

Будет плюсом, если ты

  • Внедрял SRE-практики с нуля или участвовал в их масштабировании в растущей компании.
  • Проводил воркшопы, обучал или менторил продуктовые команды по вопросам надёжности.

Что предлагаем

  • Возможность стать одним из первых участников нового стратегического направления и напрямую влиять на его развитие.
  • Масштабные технические задачи: ты будешь работать над стабильностью сервисов, которыми пользуются миллионы людей.
  • Реальное влияние на процессы: поможешь снизить уровень хаоса, сделать реагирование на инциденты и релизы более предсказуемыми.
  • Пространство для инженерных решений: команда формируется сейчас, поэтому можно участвовать в выборе подходов, стандартов и инструментов.
  • ИТ-акредитацию.
  • Удаленную работу по РФ или гибрид в городах, где есть офис (Новосибирск, Москва, Санкт-Петербург).

Поделиться:

Опубликована 4 часа назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
Привет! Мы креативное консалтинговое агентство Nau - эксперты в области CRM и продуктовой разработки. Проектируем, внедряем и развиваем цифровые системы, которые помогают бизнесу расти, автоматизировать процессы и улучшать клиентский опыт. Проект: Na...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании naunau
  • Москва
4 дня назад
Мы разрабатываем флагманский продукт компании YADRO – TATLIN.UNIFIED. Это современное хранилище данных (СХД), созданное для решения задач традиционных корпоративных приложений, больших данных и аналитики. Продукт развертывается в ЦОД, публичных и час...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании YADROYADRO
  • Москва
5 часов назад
Сетевой инженер-разработчик системы автоматизации Quality Assurance #QA #AQA #автотесты #BGP #OSPF #python ... Принимать участие в проектировании и написании последовательностей (pipelines) CI/CD Взаимодействовать с разработчиками ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Департамент персоналаДепартамент персонала
  • Москва
4 дня назад
Мы ищем старшего инженера-разработчика datapath в Nimbus. ... Мы ищем разработчика, который будет его развивать: добавлять новые возможности, ускорять и разбираться ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании QTECHQTECH
  • Москва
14 дней назад
218 800 - 287 400 ₽
Выше средней на 26%
Нам нужен инженер-изобретатель / R&D engineer, который любит разбираться с задачами, для которых ... Кто нам нужен Возможно, вы называете себя: инженер по радиолокации; инженер-разработчик РЛС; СВЧ-инженер ... ; RF engineer; инженер-антенщик; разработчик АФАР/ФАР; инженер по антенно-фидерным системам; R&D ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании STOOXXSTOOXX
  • Москва
4 дня назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.