← К каталогу
RW

RWB (Wildberries & Russ)

MLOps Engineer (Devops)

УдалённоУровень не указанМосква, Россия7 дн. назад
О ВАКАНСИИ

Описание вакансии

Направление работы:

ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс – порядка 400–500K RPS, десятки инстансов Triton.

Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем – строим общую мультитенантную ML-платформу для всего отдела.

Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.

Стань частью команды!

Вам предстоит:

  • Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;
  • Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;
  • Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;
  • Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;
  • Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);
  • Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;
  • Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.

Формат работы - гибридный или удаленный по договоренности с руководителем.

Вы нам подходите, если:

  • Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);
  • Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;
  • Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / DevOps / RU