Свяжитесь напрямую по этой вакансии
Мы развиваем post-training больших языковых моделей, в том числе разнообразные подходы online RL, и ищем человека, который умеет не только реализовывать готовые идеи, но и самостоятельно вести работу от гипотезы до измеримого роста качества модели.
Что предстоит делать:
Ищем сильного инженера с хорошим знанием Python и PyTorch, опытом в LLM post-training / online RL / RLVR и умением самостоятельно проводить ML-эксперименты от постановки гипотезы до выводов.
Будет плюсом опыт с GRPO и близкими policy optimization подходами, reward-моделями, LLM-as-a-judge, верификаторами для general-domain задач, а также с vLLM, SGLang, verl, Megatron или TRL.
Почему к нам:
Если вам интересно развивать online RL и доводить исследовательские идеи до работающих решений - пишите мне в личные сообщения.
1 месяц назад
Грейд
Senior
Тип занятости
Полная занятость
Грейд
Senior
Тип занятости
Полная занятость
ИИ напишет его по вашему резюме, останется только отправить
По компании и стране
По компании и стране