中文

停止求和:最小形式信用分配是过程奖励模型中唯一的推理方法

人工智能 2025-10-24 v3 机器学习

摘要

过程奖励模型 (PRM) 在大型语言模型 (LLM) 的有挑战性推理任务中证明了有效的测试时间扩展方法。然而,PRM导致奖励作弊问题,限制了其在强化微调中的成功应用。在本文中,我们识别出PRM导致奖励作弊的主要原因:强化学习中标准求和形式的信用分配,即将价值定义为累积的gamma衰减未来奖励,容易诱导LLM在高奖励步骤上作弊。为此,我们提出了PURE:过程监督强化学习。PURE的关键创新是一种最小形式信用分配,将价值函数形式化为未来奖励的最小值。该方法通过限制价值函数范围并更合理地分配优势,显著缓解了奖励作弊。通过在3个基础模型上的大量实验,我们展示,能够实现最小形式信用分配的PRM方法仅需30%的步骤即可实现与可验证奖励方法相当的推理性能。相比之下,标准求和形式的信用分配在训练初期就会崩溃!此外,当我们仅用10%可验证奖励补充PRM-based微调时,我们进一步缓解了奖励作弊,产生了在我们实验中表现最好的微调模型,基于Qwen2.5-Math-7B,在AMC23上实现82.5%的准确率,在5个基准测试中实现53.3%的平均准确率。我们总结了观察到的奖励作弊案例并分析训练崩溃的原因。我们在https://github.com/CJReinforce/PURE上发布了代码和模型权重。

关键词

引用

@article{arxiv.2504.15275,
  title  = {Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning},
  author = {Jie Cheng and Gang Xiong and Ruixi Qiao and Lijun Li and Chao Guo and Junle Wang and Yisheng Lv and Fei-Yue Wang},
  journal= {arXiv preprint arXiv:2504.15275},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025