Devops / SRE-инженер (ClickHouse, Kafka)

По договоренности

  • Павелецкая
  • Автозаводская
  • Технопарк

DevOps / SRE-инженер с экспертизой ClickHouse и Kafka

Приветствую! Меня зовут Эля, я являюсь HR компании «Амбрелла — Защита Информационных Систем».

Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем и сопровождаем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий информационной безопасности. В качестве хранилища событий используется ClickHouse.

Мы ищем DevOps / SRE-инженера с глубокой практической экспертизой по ClickHouse и уверенным пониманием Kafka Operations.

Основной фокус роли — промышленная эксплуатация ClickHouse в продуктивной среде: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, резервное копирование, восстановление, мониторинг, безопасность и безопасное проведение изменений.

Дополнительная важная зона — Kafka: диагностика lag, настройка topics, partitions и retention, мониторинг и анализ проблем.

Нам нужен инженер, который умеет безопасно эксплуатировать и развивать кластер с критически важными данными: планировать изменения, проверять гипотезы на стендах, оценивать риски, готовить rollback-план и только после этого применять изменения в production.

Чем предстоит заниматься:

ClickHouse и хранение данных:

  • Администрировать продуктивные и тестовые кластеры ClickHouse;
  • Контролировать состояние шардов, реплик, Distributed- и ReplicatedMergeTree-таблиц;
  • Диагностировать проблемы репликации, очередей, merges, mutations, inserts и деградации производительности;
  • Анализировать системные таблицы ClickHouse, производительность записи и чтения данных;
  • Планировать горизонтальное масштабирование и участвовать в изменении топологии кластера: добавлении шардов, реплик и серверов;
  • Оценивать влияние изменений на доступность, производительность, консистентность данных и downtime;
  • Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policies и настройки сервера;
  • Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
  • Настраивать TLS/SSL и участвовать в построении модели безопасного доступа;
  • Разрабатывать и проверять процедуры backup/restore и disaster recovery;
  • Проектировать и сопровождать архитектуру hot / warm storage, включая S3-совместимое объектное хранилище;
  • Настраивать storage policies и TTL-политики для перемещения данных между уровнями хранения;
  • Контролировать прирост данных, заполнение дисков и прогнозировать потребность в хранилище;
  • Настраивать мониторинг, алерты и дашборды по ClickHouse.


Kafka Operations:

  • Администрировать Kafka-кластеры в продуктивной и тестовой среде;
  • Контролировать состояние brokers, topics, partitions, replication factor, consumer groups и lag;
  • Настраивать и сопровождать Kafka topics под разные типы событий и профили нагрузки;
  • Планировать количество partitions, replication factor, retention policy и параметры durability;
  • Диагностировать consumer lag, rebalancing, under-replicated и offline partitions, broker failures и throughput bottlenecks;
  • Настраивать мониторинг Kafka и защищённые соединения TLS/SSL, SASL и ACL;
  • Участвовать в безопасном изменении конфигурации и обновлении Kafka-кластера.


Стенды и автоматизация:

  • Разворачивать тестовые стенды ClickHouse и Kafka для проверки архитектурных решений;
  • Проверять гипотезы по производительности, хранению, масштабированию и отказоустойчивости;
  • Проводить нагрузочные и сравнительные тесты конфигураций;
  • Проверять обновления, изменения топологии, storage policies и S3-хранилище до применения в production;
  • Автоматизировать типовые операции эксплуатации через Ansible, Bash, Python, Terraform или аналогичные инструменты;
  • Готовить runbook’и, инструкции, чек-листы, технические отчёты и практические рекомендации для команды.


Мы ожидаем:

  • Практический опыт промышленной эксплуатации ClickHouse;
  • Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree и MergeTree family;
  • Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
  • Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes и data skipping indexes;
  • Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
  • Опыт настройки TLS/SSL для ClickHouse;
  • Опыт эксплуатации Linux-серверов и понимание влияния CPU, RAM, disk I/O, network и filesystem на работу ClickHouse и Kafka;
  • Практический опыт эксплуатации Kafka или уверенное понимание Kafka Operations;
  • Понимание архитектуры Kafka: brokers, topics, partitions, replication factor, offsets и consumer groups;
  • Опыт диагностики consumer lag, broker failures, under-replicated partitions, disk pressure и throughput bottlenecks;
  • Понимание retention policy, durability, producer / consumer tuning;
  • Опыт настройки мониторинга и алертов для ClickHouse, Kafka и инфраструктуры;
  • Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
  • Умение безопасно проводить изменения в production: составлять план работ, оценивать риски, готовить rollback-план и проверять результат;
  • Умение готовить техническую документацию: инструкции, runbook’и, чек-листы и postmortem-отчёты.


Будет плюсом:

  • Опыт эксплуатации ClickHouse в составе SIEM, SOC, log management, observability, telemetry или других event-based систем;
  • Опыт работы с большими объёмами данных — сотни ТБ;
  • Опыт работы с Kafka Connect, Vector, Fluent Bit, Logstash, rsyslog или аналогичными инструментами доставки событий;
  • Опыт работы с ClickHouse Keeper или ZooKeeper;
  • Опыт эксплуатации ClickHouse / Kafka на bare metal;
  • Опыт работы с DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
  • Опыт нагрузочного тестирования ClickHouse и Kafka и построения процедур disaster recovery;
  • Опыт автоматизации через Ansible, Terraform, Bash или Python;
  • Опыт подготовки архитектурных и эксплуатационных документов для заказчиков.

    Что важно для нас:
  • Инженерная аккуратность и понимание рисков production-среды;
  • Умение проверять гипотезы на стенде до применения изменений в production;
  • Способность работать с высоконагруженными системами и критически важными данными;
  • Умение разбираться в сложных инцидентах на стыке приложения, базы данных, брокера сообщений, Linux, сети и дисковой подсистемы;
  • Готовность документировать решения и передавать знания команде;
  • Способность не только устранять проблемы, но и выстраивать устойчивые эксплуатационные процессы.


Формат работы:

  • Работа с продуктивной, тестовой и лабораторной инфраструктурой;
  • Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
  • Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения событий;
  • Оформление по ТК РФ;
  • Удаленный формат работы.


Всегда рады новым талантам и новым успехам наших сотрудников!


Адрес: Россия, Москва, улица Ленинская Слобода, 26
Показать на большой карте

Поделиться:

Опубликована 18 дней назад

Похожие вакансии

Вакансии быстро закрываются — подпишитесь на наш канал в MAX сейчас, чтобы видеть их первыми.
Подписаться в MAX
Мы в поиске опытного Сетевого инженер уровня Senior для настройки и обслуживания сетевого оборудования ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании SkillStaffSkillStaff
  • Москва
день назад
Нам нужен сильный инженер, который готов не только проектировать архитектуру, но и задавать стандарты ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании VKVK
  • Москва
день назад
У нас открыта вакансия Администратор Linux | DevOps инженер.
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании Альфа-ДеньгиАльфа-Деньги
  • Москва
3 дня назад
... Инженер, готовый предлагать решения, аргументированно отстаивать свою позицию, брать ответственность ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании MarfatechMarfatech
  • Москва
6 дней назад
250 000 - 350 000 ₽
Выше средней на 62%
Нам нужен AI/LLM-инженер уровня Middle или Senior, который готов взять на себя архитектуру ИИ-модулей ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании AEONAEON
  • Москва
9 дней назад
до 220 000 ₽
Выше средней на 18%
Приглашаем на работу инженера - проектировщика НВФ KAFT SYSTEM — стабильная и динамичная компания, уверенно ... Выполнение проектной документации на НВФ в составе группы инженеров под руководством ГИПа (стадия КМ ... - ведущий инженер - ГИП - руководитель подразделения) и горизонтального развития по различным инженерным ...
  • Можно удаленно
  • Полный день
  • Опыт от 3 лет
Логотип компании KAFT SYSTEMKAFT SYSTEM
  • Москва
9 дней назад
Мы обрабатываем данные посетителей и используем куки в соответствии с политикой конфиденциальности.