FO
ForteBank
Middle-Senior DevOps Engineer
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ
Что JobRadar наблюдает сейчас
Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.
Последнее подтверждение11 мин. назад
Впервые замечена1 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
Описание вакансии
Обязанности:
- Установка, настройка и поддержка GPU-серверов и Kubernetes-кластеров под AI-нагрузки.
- Деплой и сопровождение сервисов инференса моделей (API-шлюзы, балансировка, TLS).
- Мониторинг доступности и производительности; реагирование на инциденты 24/7.
- Управление ресурсами: квоты, шедулинг GPU, планирование мощностей.
- Обновление драйверов, CUDA, ОС и компонентов кластера без простоя сервисов.
- Настройка и контроль резервного копирования, план DR.
- Документирование конфигураций, runbook'и для типовых инцидентов.
- Взаимодействие с ML-командой: помощь с окружениями, доступами, диагностикой проблем производительности.
Требования:
- Операционные системы и виртуализация
- Уверенное администрирование Linux (Ubuntu/Debian, RHEL/Rocky): systemd, сети, планирование ресурсов, диагностика производительности (perf, htop, iostat, dmesg).
- Опыт работы с виртуализацией и контейнеризацией: Docker, containerd, желательно KVM/Proxmox/VMware. Kubernetes и оркестрация
- Практический опыт эксплуатации Kubernetes в production: деплой, отладка, RBAC, NetworkPolicy, Ingress/Gateway API.
- Понимание апстрим-сетевого стека: CNI (Calico/Cilium), LB, e — опыт с Envoy Gateway/NGINX Ingress как плюс. Helm, Kustomize; GitOps-подходы (ArgoCD/Flux) — желательно.
- GPU-инфраструктура (ключевой блок)
- Опыт администрирования серверов с NVIDIA GPU: установка драйверов, CUDA toolkit, NVIDIA Container Toolkit, диагностика (nvidia-smi, dcgm).
- Понимание механизмов распределения GPU в Kubernetes: device plugin, MIG, time-slicing, GPU Operator.
- Знание особенностей GPU-нагрузок: память VRAM, NVLink, RDMA/InfiniBand (для multi-node обучения) — как плюс.
- Сети и хранение
- Основы сетей: TCP/IP, DNS, TLS, балансировка, firewall.
- Опыт с системами хранения: NFS, Ceph/Longhorn/local-path, S3-совместимые хранилища (MinIO).
- Понимание требований ML-нагрузок к дискам и сети (пропускная способность при загрузке моделей и датасетов).
- Автоматизация и IaC
- Скриптинг…
Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.
ИсточникHeadHunter / IT / KZ