← К каталогу
CL

Cloud.ru

LlmOps-DevOps

ГибридУровень не указанМосква, Россия8 дн. назад
О ВАКАНСИИ

Описание вакансии

Обязанности:

  • Готовить LLM и другие генеративные модели к промышленному запуску;
  • Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта;
  • Создавать воспроизводимые контейнерные образы и конфигурации model serving;
  • Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью;
  • Подбирать методы квантизации и оптимизации с контролем влияния на качество модели;
  • Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки;
  • Проводить профилирование, функциональные и нагрузочные тесты моделей;
  • Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища;
  • Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes;
  • Настраивать метрики, логи и трассировку model-serving-сервисов;
  • Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей;
  • Контролировать потребление GPU, утилизацию памяти и стоимость inference;
  • Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей;
  • Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры;
  • Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы;
  • Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей;
  • Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций.

Требования:

  • Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах;
  • Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса;
  • Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным;
  • Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / DevOps / RU