2ГИС
Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)
Что JobRadar наблюдает сейчас
Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.
Описание вакансии
2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей.
Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.
Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.
Чем предстоит заниматься
Развивать Incident & Problem Management
- внедрять и развивать единый процесс управления инцидентами;
- формировать культуру postmortem-разборов без поиска виноватых;
- контролировать выполнение action items, направленных на предотвращение повторных сбоев;
- улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования.
Развивать observability
- стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов;
- участвовать в создании единой платформы мониторинга и визуализации;
- разрабатывать стандарты логирования;
- контролировать объём и качество данных, поступающих в системы телеметрии.
Трансформировать подход к алертингу
- проводить аудит существующих алертов и снижать число ложных срабатываний;
- формировать единые принципы приоритизации алертов с учётом критичности сервисов;
- помогать командам настраивать полезные, своевременные и понятные уведомления.
Внедрять SRE-практики и повышать зрелость команд
- участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP;
- помогать командам определять и внедрять SLO/SLA;
- создавать дашборды для контроля Error Budget;
- разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов;
- консультировать продуктовые команды по вопросам стабильности и надёжности.
Автоматизировать процессы
- …
Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.