← К каталогу
VK

VK

Senior Site Reliability Engineer

УдалённоSeniorМосква, Россия1 ч назад
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ

Что JobRadar наблюдает сейчас

Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.

Последнее подтверждение25 мин. назад
Впервые замечена1 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
О ВАКАНСИИ

Описание вакансии

Задачи

  • Развивать и сопровождать инфраструктуру highload-системы, повышать надёжность, доступность и производительность
  • Внедрять и поддерживать SLO/SLI и практики error budget, выстраивать алертинг на основе пользовательских метрик и приоритизации
  • Развивать observability (Prometheus/Alertmanager, Grafana, централизованные логи): делать эксплуатационные дашборды, настраивать алерты, снижать alert noise, улучшать MTTD/MTTR
  • Автоматизировать рутинные операции и эксплуатационные процессы, снижать toil, развивать self-service подходы для команд разработки
  • Участвовать в on-call , оперативно реагировать и устранять инциденты, координировать восстановление, проводить postmortem и доводить улучшения до продакшена
  • Взаимодействовать с командами разработки и смежными инфраструктурными командами: участвовать в архитектурных обсуждениях, ревью изменений, согласовании требований к production readiness
  • Вести и развивать эксплуатационную документацию : писать и актуализировать runbooks/playbooks для типовых инцидентов и деградаций, инструкции по релизам/роллбэкам и аварийным процедурам (в том числе DR), документировать дашборды/алерты и схемы зависимостей/эскалаций

Требования

  • Опыт 5+ лет в SRE/DevOps/Platform/System Engineering, опыт эксплуатации highload -систем
  • Глубокие знания Linux : администрирование, диагностика производительности (CPU/mem/io), анализ деградаций, systemd, файловые системы, лимиты/квоты, troubleshooting на production
  • Сетевые основы для диагностики : TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7 балансировка, keepalive; умение находить и устранять сетевые причины деградаций
  • Опыт эксплуатации распределённых систем : понимание partial failures, timeouts/retries, backpressure, graceful degradation
  • Облака: опыт эксплуатации инфраструктуры в публичном облаке — сети и балансировщики, autoscaling, IAM/роль‐модель; построение отказоустойчивости по зонам/регионам, базовые DR-подходы
  • Контейнеры и Kubernetes: понимание контейнеризации и…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / DevOps / RU