← К каталогу
2Г

2ГИС

Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)

УдалённоSeniorМосква, Россия6 дн. назад
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ

Что JobRadar наблюдает сейчас

Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.

Последнее подтверждение20 мин. назад
Впервые замечена2 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
О ВАКАНСИИ

Описание вакансии

2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей.

Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.

Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.

Чем предстоит заниматься

Развивать Incident & Problem Management

  • внедрять и развивать единый процесс управления инцидентами;
  • формировать культуру postmortem-разборов без поиска виноватых;
  • контролировать выполнение action items, направленных на предотвращение повторных сбоев;
  • улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования.

Развивать observability

  • стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов;
  • участвовать в создании единой платформы мониторинга и визуализации;
  • разрабатывать стандарты логирования;
  • контролировать объём и качество данных, поступающих в системы телеметрии.

Трансформировать подход к алертингу

  • проводить аудит существующих алертов и снижать число ложных срабатываний;
  • формировать единые принципы приоритизации алертов с учётом критичности сервисов;
  • помогать командам настраивать полезные, своевременные и понятные уведомления.

Внедрять SRE-практики и повышать зрелость команд

  • участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP;
  • помогать командам определять и внедрять SLO/SLA;
  • создавать дашборды для контроля Error Budget;
  • разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов;
  • консультировать продуктовые команды по вопросам стабильности и надёжности.

Автоматизировать процессы

  • …

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / DevOps / RU