← К каталогу
FO

ForteBank

AI Engineer (Senior) - Speech & Voice AI

ОфисSeniorАстана, Казахстан3 ч назад
СИГНАЛ JOBRADAR75/100Нормальный сигнал актуальности
ПАСПОРТ ВАКАНСИИ

Что JobRadar наблюдает сейчас

Балл строится только на фактах из источников: свежести подтверждения, возрасте записи и происхождении вакансии. Это не гарантия найма и не оценка работодателя.

Последнее подтверждение10 мин. назад
Впервые замечена2 ч назад
Активные источники1 источник
ПроисхождениеПубличный источник
О ВАКАНСИИ

Описание вакансии

Обязанности:

  • Подбирать, обучать и дообучать модели распознавания и синтеза речи (ASR/TTS), а также speech-to-speech модели для голосовых AI-сервисов банка.
  • Развивать качество работы моделей на казахском и русском языках: учитывать смешанную речь, банковскую терминологию, имена, суммы и шумные условия.
  • Проектировать голосовые диалоги в реальном времени: потоковую обработку аудио, определение конца реплики, обработку перебиваний и full-duplex взаимодействие, при котором агент одновременно слушает пользователя и отвечает ему.
  • Готовить речевые датасеты: очищать и размечать аудио, формировать обучающие и тестовые выборки, проводить эксперименты и анализировать ошибки моделей.
  • Интегрировать речевые модели с голосовыми агентами на LiveKit Agents или аналогичной платформе, backend-сервисами и мобильными каналами банка.
  • Оптимизировать качество и скорость ответа, потребление GPU и устойчивость сервиса при одновременных голосовых сессиях.
  • Готовить модели и голосовые сервисы к промышленной эксплуатации в защищённом контуре банка.

Требования:

  • Уверенное владение Python и PyTorch.
  • Практический опыт обучения или fine-tuning речевых моделей, а не только интеграции готовых облачных ASR/TTS API.
  • Обязательный опыт работы с LiveKit Agents / LiveKit Server либо аналогами для потоковых голосовых приложений.
  • Понимание архитектур ASR, TTS и speech-to-speech, методов подготовки аудиоданных и оценки качества речевых моделей.
  • Опыт работы со streaming inference, VAD, turn detection, endpointing и обработкой перебиваний (barge-in).
  • Понимание особенностей full-duplex диалога, включая одновременную речь пользователя и агента.
  • Опыт вывода ML-моделей в production: разработка API, Docker, мониторинг, профилирование и оптимизация инференса на GPU.
  • Умение строить воспроизводимые эксперименты и находить баланс между качеством модели, задержкой ответа и стоимостью вычислений.

Будет преимуществом: ​​​​​​​

  • Опыт обучения речевых моделей для…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / IT / KZ