← К каталогу
CL

Cloud.ru

SRE

УдалённоУровень не указанМосква, Россия1 ч назад
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ

Что JobRadar наблюдает сейчас

Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.

Последнее подтверждение26 мин. назад
Впервые замечена1 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
О ВАКАНСИИ

Описание вакансии

На этой позиции тебе предстоит:

  • Отвечать за production
  • Проектировать, разрабатывать, внедрять и поддерживать SLO/SLI, метрики, алерты, ранбуки и дашборды для продукта
  • Повышать наблюдаемость и надежность продукта
  • Участвовать в устранении аварий и последующей стабилизации продукта
  • Участвовать в заполнении и разборе постмортемов
  • Разрабатывать и выполнять меры, направленные на предотвращение повторных инцидентов
  • Автоматизировать рутинную работу
  • Разрабатывать DRP
  • Участвовать в разработке процессов, используемых в работе

Что мы ждем от кандидата:

  • Свободно и на экспертном уровне работаете с Linux-системами и занимались их промышленной эксплуатацией
  • Понимаете, что такое load balancing, circuit breakers, disaster recovery и т.п.
  • Понимаете, что такое SLO и SLI и умеете применять их на практике
  • Имеете опыт работы с Grafana, Prometheus, k8s
  • Понимаете принципы IaC-подхода к описанию инфраструктуры; понимаете, как работают сети и умеете диагностировать и решать проблемы в их работе

Дополнительно

пишете на Go / Python / bash и т.п. в объеме, достаточном для автоматизации повседневной работы; имеете практический опыт работы SRE; знаете, как сделать отказоустойчивый масштабируемый сервис; умеете работать с системами управления

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / DevOps / RU