[Перевод] Создание моделей, способных к рассуждению, с помощью дообучения GRPO
Habr ·
![[Перевод] Создание моделей, способных к рассуждению, с помощью дообучения GRPO](https://habrastorage.org/getpro/habr/upload_files/d69/835/810/d69835810509eceae699ffd0242c3c65.jpg)
Модели вроде DeepSeek показали, что способность к последовательному рассуждению можно заметно улучшить на этапе дополнительного обучения. Если задача состоит в том, чтобы получить похожее поведение от локальной LLM, один из вариантов - Group Relative Policy Optimization, или GRPO. В отличие от Supervised Fine-Tuning, где модель в основном учится воспроизводить шаблоны из обучающих примеров, GRPO использует обучение с подкреплением. В этом случае модель получает сигнал о качестве сгенерированных ответов и постепенно увеличивает вероятность более удачных вариантов. Разберём, как GRPO связан с современными подходами RLHF и что происходит во время такого обучения. Читать далее
Модели вроде DeepSeek показали, что способность к последовательному рассуждению можно заметно улучшить на этапе дополнительного обучения. Если задача состоит в том, чтобы получить похожее поведение от локальной LLM, один из вариантов - Group Relative Policy Optimization, или GRPO. В отличие от Supervised Fine-Tuning, где модель в основном учится воспроизводить шаблоны из обучающих примеров, GRPO использует обучение с подкреплением. В этом случае модель получает сигнал о качестве сгенерированных ответов и постепенно увеличивает вероятность более удачных вариантов. Разберём, как GRPO связан с современными подходами RLHF и что происходит во время такого обучения. Читать далее