中文

基于问题改写的GRPO转换增强,提高大语言模型推理中的探索能力

机器学习 2026-05-20 v5

摘要

群相对策略优化(GRPO)已成为大语言模型中基于可验证奖励的强化学习主导方法,但存在两个关键局限:梯度消失和多样性崩溃。当训练问题过于简单或过于困难时,所有抽样响应获得相同的奖励,从而导致梯度为零。此外,模型倾向于向单一推理模式收缩,而非探索多样化策略。我们提出转换增强GRPO(TA-GRPO),一种简单却有效的方法,通过问题改写来解决上述两个问题。对于每个训练问题,我们自动生成多个等价改写问题,这些改写问题在措辞、格式和信息顺序上发生变化,但保持 underlying 意义不变。由于这些改写问题改变了模型对难度的感知,跨原始问题及其改写问题抽样的响应将获得混合奖励和更具多样性的推理路径。TA-GRPO在这个扩充的响应集合上联合计算优势,并将所有重要性比值对齐到原始问题,从而使模型能够从更丰富的解答尝试中学习。在四个大语言模型(Qwen3-1.7B、Qwen3-4B、Llama-3.2-1B、Llama-3.2-3B)上的实验表明,TA-GRPO在竞赛水平基准测试(AMC、OlympiadBench、AIME24、AIME25)和超出分布基准测试(Minerva、GPQA-Diamond)上的pass@kk指标均实现一致提升。显著的是,Qwen3-1.7B和Qwen3-4B的平均pass@32分别提升了\textbf{4.97}和\textbf{4.34}分,还能在相当于更多2.5倍数据的基线训练中匹配其探索质量。

关键词

引用

@article{arxiv.2601.22478,
  title  = {Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models},
  author = {Khiem Le and Phuc Nguyen and Youssef Mroueh and Chi-Heng Lin and Shangqian Gao and Ting Hua and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:2601.22478},
  year   = {2026}
}