← К каталогу
ДЕ

Детский мир

ML-Ops инженер

УдалённоУровень не указанМосква, Россия9 дн. назад
О ВАКАНСИИ

Описание вакансии

«Детмир Тех» — команда, развивающая цифровую экосистему группы компаний «Детский мир». Делаем продукты для миллионов клиентов и сервисы, которые помогают бизнесу работать быстрее.

Кого ищем:

ИИ-платформа «Детского Мира» уже работает в проде: LLM-гейтвей с квотами, RAG, агентные сценарии, трассировка и собственный инференс на GPU. Ищем MLOps-инженера ИИ-платформы и агентской платформы. Основная задача роли - работа над качеством решений и улучшение утилизации ресурсов (GPU/токены).

Чем предстоит заниматься:

  • Строить систему оценки качества LLM-решений: golden set, LLM-as-judge, метрики retrieval (recall@k, groundedness), регрессионные гейты промптов и RAG в CI.
  • Развивать ML мониторинг: дашборды p95, RPS, uptime, утилизации GPU и расхода токенов, централизованные логи, алерты.
  • Управлять инференсом: собственный vLLM плюс внешние модели через провайдеров - роутинг по сложности, fallback, semantic cache.
  • Настраивать квоты GPU и токенов по командам и доменам, приоритетные очереди, учёт стоимости в рублях.
  • Искать проблемы с качествов на живом трафике раньше, чем поступят жалобы пользователей.
  • Развивать CI/CD: eval-гейты, canary, откат; тестовый контур, бэкапы и восстановление.
  • Развивать STT-контур: транскрипция и саммеризация встреч.

Что ожидаем от вас:

  • Опыт вывода ML-моделей в production и их сопровождения;
  • Практический опыт с Docker, Kubernetes и CI/CD;
  • Понимание полного жизненного цикла ML-модели: эксперименты, валидация, версионирование моделей и данных, Model Registry;
  • Опыт разработки ML-платформ и сервисов, а не только поддержки инфраструктуры;
  • Понимание принципов мониторинга ML-систем: latency, uptime, error rate, drift данных и моделей, контроль качества и алертинг;
  • Опыт построения и сопровождения асинхронных пайплайнов;
  • Знание Kafka или RabbitMQ;
  • Уверенный Python: автоматизация, скрипты, ML-пайплайны, работа с API;
  • Понимание подходов к оценке качества LLM и AI-агентов: eval-датасеты, сценарные метрики…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / Data Scientist / RU