SberTech
Site Reliability Engineer(SRE)
Что JobRadar наблюдает сейчас
Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.
Описание вакансии
AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов.
Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы.
Технологический стек:
- PostgreSQL — основное хранилище данных
- Kubernetes — оркестрация
- Kafka — обмен событиями
- Redis — кэширование
- S3 (совместимое объектное хранилище) — данные и бэкапы
- Qdrant — векторная база знаний
- Prometheus + Grafana — мониторинг
- OpenSearch — логи
Твои задачи:
- обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem
- разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC)
- управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг
- диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса
- настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды
- управление секретами и доступом, выполнение требований безопасности
- работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы
- участие в архитектурных решениях для новых сервисов платформы.
Мы ожидаем, что у тебя есть:
- 3+ года опыта в SRE / DevOps / платформенной инфраструктуре
- глубокий опыт работы с Kubernetes в промышленной эксплуатации
- PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление
- Kafka, Redis, S3-совместимые объектные хранилища
- CI/CD, Linux, Bash
- мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг
- понимание принципов SLO / SLI / Error Budgets
- опыт…
Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.