中文

一种仅需一个训练示例的大型语言模型强化学习推理方法

机器学习 2025-10-27 v3 人工智能 计算与语言

摘要

我们表明,使用单个训练示例(1-shot RLVR)的可验证奖励强化学习,对大型语言模型 (LLM) 的数学推理能力具有有效的激励作用。将 RLVR 应用于基础模型 Qwen2.5-Math-1.5B,我们发现单个示例即可将模型在 MATH500 上的性能提升至 73.6%(超过格式纠正 8.6%),并将六个常见数学推理基准测试的平均性能从 17.6% 提升至 35.7%(非格式性提升 7.0%)。该结果与包含上述示例的 1.2k DeepScaleR 子集(MATH500: 73.6%,平均值: 35.9%)的性能相当。此外,仅使用两个示例的 RLVR 甚至略微超出了这些结果(MATH500: 74.8%,平均值: 36.6%)。在 various 模型(Qwen2.5-Math-7B、Llama3.2-3B-Instruct、DeepSeek-R1-Distill-Qwen-1.5B)、RL 算法(GRPO 和 PPO)以及不同数学示例方面,都观察到类似的显著性改进。在 1-shot RLVR 期间,我们还识别出一些有趣的现象,包括跨类别泛化、自反思频率增加以及在训练准确率饱和后仍保持测试性能提升的现象,我们称之为超饱和泛化。此外,我们验证了 1-shot RLVR 的有效性主要来自策略梯度损失, distinguishing 于“grokking” 现象。我们还展示了在 1-shot RLVR 训练中促进探索(例如,通过以适当系数纳入熵损失)的关键作用。我们还进一步讨论了关于格式纠正、标签鲁棒性和提示修改的相关观察。这些发现可以激发未来在 RLVR 效率方面的工作,并鼓励重新审视 RLVR 最近的进展及其背后的机制。所有资源均在 https://github.com/ypwang61/One-Shot-RLVR 上开放。

关键词

引用

@article{arxiv.2504.20571,
  title  = {Reinforcement Learning for Reasoning in Large Language Models with One Training Example},
  author = {Yiping Wang and Qing Yang and Zhiyuan Zeng and Liliang Ren and Liyuan Liu and Baolin Peng and Hao Cheng and Xuehai He and Kuan Wang and Jianfeng Gao and Weizhu Chen and Shuohang Wang and Simon Shaolei Du and Yelong Shen},
  journal= {arXiv preprint arXiv:2504.20571},
  year   = {2025}
}

备注

link: https://github.com/ypwang61/One-Shot-RLVR