← К каталогу
SB

SberTech

Site Reliability Engineer(SRE)

ОфисУровень не указанМосква, Россия2 ч назад
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ

Что JobRadar наблюдает сейчас

Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.

Последнее подтверждение28 мин. назад
Впервые замечена2 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
О ВАКАНСИИ

Описание вакансии

AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов.

Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы.

Технологический стек:

  • PostgreSQL — основное хранилище данных
  • Kubernetes — оркестрация
  • Kafka — обмен событиями
  • Redis — кэширование
  • S3 (совместимое объектное хранилище) — данные и бэкапы
  • Qdrant — векторная база знаний
  • Prometheus + Grafana — мониторинг
  • OpenSearch — логи

Твои задачи:

  • обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem
  • разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC)
  • управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг
  • диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса
  • настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды
  • управление секретами и доступом, выполнение требований безопасности
  • работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы
  • участие в архитектурных решениях для новых сервисов платформы.

Мы ожидаем, что у тебя есть:

  • 3+ года опыта в SRE / DevOps / платформенной инфраструктуре
  • глубокий опыт работы с Kubernetes в промышленной эксплуатации
  • PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление
  • Kafka, Redis, S3-совместимые объектные хранилища
  • CI/CD, Linux, Bash
  • мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг
  • понимание принципов SLO / SLI / Error Budgets
  • опыт…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / DevOps / RU