Site Reliability Engineer
По договоренности
О роли
Мы ищем того, кто готов решать сложные задачи, погружаться в детали, быть хранителем стабильности и надежности наших сервисов. Если ты считаешь, что совершенство — это не цель, а путь, готов предлагать новые решения и внедрять передовые технологии, мы будем рады видеть тебя в нашей команде.
Почему это важно
Наша главная цель — поддерживать такие условия, при которых пользователи могут наслаждаться стабильностью и надежностью наших сервисов, открывая для себя новые горизонты звука.
Чем предстоит заниматься:
- Надежность и инциденты: Работа с инцидентом на всех этапах. Учавствовать в активных инцидентах в качестве координатора и/или инженера починки. Расследовать инциденты, проводить Post-mortem встречи с командами Dev/QA/OPS. Разрабатывать и актуализировать: планы восстановления, инструкции для дежурных, DRP. Проводить мероприятия на снижение MTTR, количество инцидентов. Участие в коммуникации с партнерами в рамках общих инцидентов;
- SLA/SLO и Error Budget: Внедрять и контролировать метрики надежности SLI/SLO/SLA внутренние и внешние. Участвовать в приоритизации бэклога разработки на основе анализа Error Budget;
- Observability (Наблюдаемость): Развивать системы мониторинга и трейсинга совместно с подразделением мониторинга (настраивать сбор метрик, дашборды в Grafana);
- Инфраструктура и K8s: Администрировать Kubernetes кластеры (ресурсы, автоскейлинг). Управлять сервис-мешем (Istio): настраивать сетевые политики, traffic routing, rate limiting, circuit breakers. Управление конфигурацией location nginx;
- Дежурства в рабочее время: контроль сетки релизов, реагирование на обращения коллег DEV по проблемам в межсервисном взаимодействии. Анализировать логи и трейсы в Jaeger/Tempo, Kibana/Loki;
- Дежурства в НЕрабочее время: реагирование и подключение на инциденты во внерабочее время. На текущем этапе команда переходит от добровольной к плановой системе дежурств. Нужно быть готовым к дежурствам в праздничные дни и каникулы. Все часы дежурств и вызовов во внерабочее время оплачиваются дополнительно.
Успех в роли обеспечат:
- Опыт в SRE / DevOps от 2-3 лет. Понимание идеологии SRE, опыт работы с SLI/SLO/SLA и Error Budget на практике. Опыт работы в production окружениях;
- уверенное администрирование. Понимание того, как работают операторы, сетевые модели и механизмы отказоустойчивости на уровне Pod/Deployment;
- опыт участия в дежурствах или роли Incident Commander. Умение не просто «тушить пожары», а системно устранять их первопричины;
- опыт настройки алертинга, опыт написания инструкций и DRP;
- уверенное написание скриптов и небольших сервисов/ботов на Go или Python и Bash.
Адрес: Россия, Москва, Поклонная улица, 3
Опубликована 7 дней назад
Похожие вакансии
Вакансии быстро закрываются — подпишитесь на наш канал в MAX сейчас, чтобы видеть их первыми.
Подписаться в MAXКто мы? JuicyScore — проприетарный антифрод-продукт, работающий без использования персональных данных. С 2015 года создаём решения для борьбы с мошенничеством и управления рисками. Наши клиенты — финансовые институты в 45+ странах. Аккредитованная IT...
- Полный день
- Опыт от 1 года
- Москва
2 дня назад
Data Engineer Основные задачи: Создание и наполнение единого хранилища данных Создание, тестирование, ...
- Полный день
- Опыт от 1 года
- Москва
21 час назад
Задачи: Проектировать и реализовывать ETL-слои для информационных потоков; Проектировать и реализовывать модели данных; Реализовывать расчетные показатели; Оптимизировать существующие скрипты по обработке данных Создавать витрины для передачи данных ...
- Полный день
- Опыт от 1 года
- Москва
2 дня назад
200 000 - 350 000 ₽
Выше средней на 43%
Наш клиент - аккредитованная IT компания, разработчики ПО Приглашает на работу - ML-Engineer Требования ...
- Полный день
- Опыт от 1 года
- Москва
3 дня назад
inSales — часть системы бизнес-сервисов Сбер2B. Вместе мы решаем комплексные задачи бизнеса и регионов с помощью аналитики больших данных, автоматизации и ЭДО. inSales в цифрах: 15+ лет помогаем бизнесу развивать онлайн-продажи 30 млн человек ежемеся...
- Полный день
- Опыт от 1 года
- Москва
3 дня назад
Вакансия в подборках
Похожие вакансии
200 000 - 350 000 ₽