自适应引导加速推理模型的强化学习
机器学习
2025-06-23 v2 人工智能
计算与语言
摘要
我们研究了在可验证奖励上进行强化学习的推理模型学习解决新问题的过程。我们发现,RLVR 通过两种主要方式提升性能:(1) 将 pass@ 压缩为 pass@1,(2) 通过模型学习解决其之前无法解决的新问题实现“能力提升”。我们发现,尽管能力提升在不同模型规模上都存在,但学习解决新问题主要通过自蒸馊实现。我们在 0.5B 至 72B 参数规模的模型上,通过超过 50 万道包含数学、科学和代码领域问题及可验证最终答案的题目,验证了这些发现。进一步表明,我们可以通过引入自然语言指导,使模型在上下文中考虑这些指导,同时仍要求模型从头生成解题链,从而显著提高 pass@ 的解题率。基于这些洞见,我们提出了 —— 一类新的在线训练算法。 在所有 rollout 最初都错误的题目上自适应地将提示纳入模型上下文,并调整“离策略”轨迹的重要性抽样比例,以优化在提示不存在的情境下的策略。我们为 GRPO 和 PPO 描述了 的变体,并在 7B 和 32B 参数模型上实证表明,Guide-GRPO 在数学基准测试中相对于其纯粹版本可实现最高达 4% 的宏观平均提升。我们包括对 各组成部分的严谨消除实验,并对 Guide 的学习效率进行了理论分析。
引用
@article{arxiv.2506.13923,
title = {Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models},
author = {Vaskar Nath and Elaine Lau and Anisha Gunjal and Manasi Sharma and Nikhil Baharte and Sean Hendryx},
journal= {arXiv preprint arXiv:2506.13923},
year = {2025}
}