← К каталогу
СБ

СБЕР

ML-инженер (Online RL) / Post-Training LLM

Формат не указанУровень не указанМосква, Россия6 дн. назад
О ВАКАНСИИ

Описание вакансии

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.

Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат

Обязанности

Разрабатывать и улучшать методы online RL

Реализовывать и дорабатывать подходы post-training и online RL.

Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.

Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.

Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.

Строить и развивать инфраструктуру обучения

Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.

Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.

Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.

Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.

Работать с данными и системой оценки качества

Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.

Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.

Анализировать ошибки модели, выявлять систематические слабые места и формировать…

Здесь показан очищенный фрагмент описания из источника. Полные условия и актуальность вакансии проверьте на странице работодателя.

ИсточникHeadHunter / Data Scientist / RU