G$^2$RPO-A:具有自适应引导的引导式分组相对策略优化
人工智能
2025-08-19 v1
摘要
基于可验证奖励的强化学习 (RLVR) 显著增强了大语言模型 (LLMs) 的推理能力。然而,其成功在很大程度上依赖于具备丰富世界知识的强大基座模型,对于小规模语言模型 (SLMs) 仅能带来有限的改进。为解决这一局限,我们研究了引导式 GRPO,该方法将真实的推理步骤注入到展开轨迹中,以弥补 SLMs 的内在弱点。通过对各种引导配置的全面研究,我们发现简单地添加引导带来的收益有限。这些见解催生了 GRPO-A,一种自适应算法,能够根据模型不断变化的训练动态自动调整引导强度。在数学推理和代码生成基准上的实验证实,GRPO-A 显著优于原始的 GRPO。我们的代码和模型可在 https://github.com/T-Lab-CUHKSZ/G2RPO-A 获取。
引用
@article{arxiv.2508.13023,
title = {G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance},
author = {Yongxin Guo and Wenbo Deng and Zhenglin Cheng and Xiaoying Tang},
journal= {arXiv preprint arXiv:2508.13023},
year = {2025}
}