cases
[Перевод] Создание моделей, способных к рассуждению, с помощью дообучения GRPO
Модели вроде DeepSeek показали, что способность к последовательному рассуждению можно заметно улучшить на этапе дополнительного обучения. Если задача состоит в том, чтобы получить похожее поведение от локальной LLM, один из вариантов - Group Relative Policy Optimization, или GRPO. В отличие от Supervised Fine-Tuning, где модель в основном учится воспроизводить шаблоны из обучающих примеров, GRPO использует обучение с подкреплением. В этом случае модель получает сигнал о качестве сгенерированных ответов и постепенно увеличивает вероятность более удачных вариантов. Разберём, как GRPO связан с современными подходами RLHF и что происходит во время такого обучения.
Читать далее →