DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

По договоренности

  • Павелецкая
  • Автозаводская
  • Технопарк

DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

Привет! Меня зовут Эля, я HR компании «Амбрелла».
Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.
Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB.
Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.
Вторая важная зона — MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.
Нам нужен инженер, который умеет не просто «поднять базу», а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.

Чем предстоит заниматься: ClickHouse:
— Администрировать продуктивные и тестовые кластеры ClickHouse;
— Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;
— Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;
— Анализировать системные таблицы ClickHouse и состояние кластера;
— Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;
— Планировать горизонтальное масштабирование ClickHouse-кластера;
— Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;
— Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;
— Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;
— Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
— Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;
— Разрабатывать и проверять backup/restore и disaster recovery;
— Настраивать мониторинг, алерты и дашборды по ClickHouse;
— Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты.

MariaDB:
— Администрировать продуктивные и тестовые инсталляции MariaDB;
— контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;
— Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;
— Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;
— Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;
— Настраивать, сопровождать и диагностировать Galera Cluster;
— Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;
— Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;
— Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;
— Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;
— Настраивать TLS/SSL для клиентских подключений и репликации;
— Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB.

Production, автоматизация и взаимодействие:
— Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;
— Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;
— Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;
— Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;
— Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;
— Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;
— Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;
— Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.

Обязательные требования:
— Практический опыт промышленной эксплуатации ClickHouse;
— Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;
— Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
— Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;
— Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
— Опыт настройки TLS/SSL для ClickHouse;
— Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;
— Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;
— Опыт настройки и диагностики репликации MariaDB;
— Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;
— Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;
—Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;
— Опыт эксплуатации Linux-серверов;
— Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;
— Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;
— Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
— Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;
— Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;
— Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты.

Желательные требования:
— Опыт или уверенное понимание Galera Cluster;
— Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;
— Опыт работы с большими объёмами данных: десятки или сотни ТБ;
— Опыт работы с ClickHouse Keeper или ZooKeeper;
— Опыт эксплуатации ClickHouse / MariaDB на bare metal;
— Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
— Опыт нагрузочного тестирования ClickHouse и MariaDB;
— Опыт построения процедур disaster recovery;
— Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;
— Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;
— Опыт проведения регламентных работ с минимальным downtime;
— Опыт аудита продуктивных инсталляций у заказчиков.

Что важно в кандидате:
— Инженерная аккуратность и понимание рисков production-среды;
— Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;
— Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;
— Клиентоориентированность и зрелая коммуникация;
— Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;
— Способность лидировать технические встречи, фиксировать решения и следующие шаги;
— Готовность документировать решения и передавать знания команде.

Условия:
— Постоянная занятость;
— Работа с продуктивной, тестовой и лабораторной инфраструктурой;
— Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
— Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.

Всегда рады новым талантам и новым успехам наших сотрудников!


Адрес: Россия, Москва, улица Ленинская Слобода, 26
Показать на большой карте

Поделиться:

Опубликована 18 дней назад

Похожие вакансии

Вакансии быстро закрываются - скачайте мобильное приложение в RuStore и откликайтесь первыми!
Скачать бесплатно
Мы ищем опытного DevOps-инженера Ключевая задача - построить инфраструктуру с нуля.
  • Можно удаленно
  • Полный день
  • Опыт от 5 лет
Логотип компании SkillStaffSkillStaff
  • Москва
2 дня назад
275 900 - 373 600 ₽
Выше средней на 41%
ЛНС-БЮРО — инженерная компания, специализирующаяся на проектировании, инженерных изысканиях, капитальном ремонте, обследовании зданий и сопровождении экспертизы. Мы ищем сильного ГИПа, способного вести сложные проекты, принимать технические решения и...
  • Можно удаленно
  • Полный день
  • Опыт от 5 лет
Логотип компании ЛНС-БЮРОЛНС-БЮРО
  • Москва
4 дня назад
от 150 000 ₽
Проектная организация ООО "МИТ" (дороги, мосты, тоннели) в поисках Ведущего инженера ПОС.
  • Можно удаленно
  • Полный день
  • Опыт от 5 лет
Логотип компании Мосты и ТрубыМосты и Трубы
  • Москва
5 дней назад
Привет, мы — NGENIX — команда профессионалов, которая ежедневно делает Рунет безопасной средой для бизнеса. Нам есть что рассказать о доступности, защите и ускорении веб-приложений, ведь это то, чем мы занимаемся уже 18 лет! Слышали про UDP flood, cr...
  • Можно удаленно
  • Полный день
  • Опыт от 5 лет
Логотип компании NGENIXNGENIX
  • Москва
5 дней назад
Мы ищем специалиста по искусственному интеллекту, который поможет внедрять и развивать AI-решения в бизнес-процессах Корпорации. При этом опирается на опыт реальной разработки и умеет доводить прототипы до надёжной эксплуатации. Чем предстоит занимат...
  • Можно удаленно
  • Полный день
  • Опыт от 5 лет
Логотип компании Корпорация ВСМПО-АВИСМАКорпорация ВСМПО-АВИСМА
  • Москва
2 дня назад
Дневник.ру входит в ТОП-10 мировых образовательных платформ по посещаемости. Это продукт для школ и организаций, позволяющий вести образовательную деятельность в облачном решении. Дневник.ру - это высоконагруженная система, которая находится online 2...
  • Можно удаленно
  • Полный день
  • Опыт от 5 лет
Логотип компании Дневник.руДневник.ру
  • Москва
11 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.