Свяжитесь напрямую по этой вакансии
Мы развиваем post-training больших языковых моделей, в том числе разнообразные подходы online RL, и ищем человека, который умеет не только реализовывать готовые идеи, но и самостоятельно вести работу от гипотезы до измеримого роста качества модели.
Что предстоит делать:
Ищем сильного инженера с хорошим знанием Python и PyTorch, опытом в LLM post-training / online RL / RLVR и умением самостоятельно проводить ML-эксперименты от постановки гипотезы до выводов.
Будет плюсом опыт с GRPO и близкими policy optimization подходами, reward-моделями, LLM-as-a-judge, верификаторами для general-domain задач, а также с vLLM, SGLang, verl, Megatron или TRL.
Почему к нам:
Если вам интересно развивать online RL и доводить исследовательские идеи до работающих решений - пишите мне в личные сообщения.
Полная занятость
Тип занятости
Senior
Грейд
Data Science & ML
Специализация
AI
Отрасль
Корпорация
Тип компании
Полная занятость
Тип занятости
Senior
Грейд
Data Science & ML
Специализация
AI
Отрасль
Корпорация
Тип компании
По компании и стране
По компании и стране