← К каталогу
FO

ForteBank

Middle-Senior DevOps Engineer

ОфисSeniorАстана, Казахстан1 ч назад
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ

Что JobRadar наблюдает сейчас

Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.

Последнее подтверждение11 мин. назад
Впервые замечена1 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
О ВАКАНСИИ

Описание вакансии

Обязанности:

  • Установка, настройка и поддержка GPU-серверов и Kubernetes-кластеров под AI-нагрузки.
  • Деплой и сопровождение сервисов инференса моделей (API-шлюзы, балансировка, TLS).
  • Мониторинг доступности и производительности; реагирование на инциденты 24/7.
  • Управление ресурсами: квоты, шедулинг GPU, планирование мощностей.
  • Обновление драйверов, CUDA, ОС и компонентов кластера без простоя сервисов.
  • Настройка и контроль резервного копирования, план DR.
  • Документирование конфигураций, runbook'и для типовых инцидентов.
  • Взаимодействие с ML-командой: помощь с окружениями, доступами, диагностикой проблем производительности.

Требования:

  • Операционные системы и виртуализация
  • Уверенное администрирование Linux (Ubuntu/Debian, RHEL/Rocky): systemd, сети, планирование ресурсов, диагностика производительности (perf, htop, iostat, dmesg).
  • Опыт работы с виртуализацией и контейнеризацией: Docker, containerd, желательно KVM/Proxmox/VMware. Kubernetes и оркестрация
  • Практический опыт эксплуатации Kubernetes в production: деплой, отладка, RBAC, NetworkPolicy, Ingress/Gateway API.
  • Понимание апстрим-сетевого стека: CNI (Calico/Cilium), LB, e — опыт с Envoy Gateway/NGINX Ingress как плюс. Helm, Kustomize; GitOps-подходы (ArgoCD/Flux) — желательно.
  • GPU-инфраструктура (ключевой блок)
  • Опыт администрирования серверов с NVIDIA GPU: установка драйверов, CUDA toolkit, NVIDIA Container Toolkit, диагностика (nvidia-smi, dcgm).
  • Понимание механизмов распределения GPU в Kubernetes: device plugin, MIG, time-slicing, GPU Operator.
  • Знание особенностей GPU-нагрузок: память VRAM, NVLink, RDMA/InfiniBand (для multi-node обучения) — как плюс.
  • Сети и хранение
  • Основы сетей: TCP/IP, DNS, TLS, балансировка, firewall.
  • Опыт с системами хранения: NFS, Ceph/Longhorn/local-path, S3-совместимые хранилища (MinIO).
  • Понимание требований ML-нагрузок к дискам и сети (пропускная способность при загрузке моделей и датасетов).
  • Автоматизация и IaC
  • Скриптинг…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / IT / KZ