中文

通过隐式奖励进行过程强化

机器学习 2025-09-29 v2 人工智能 计算与语言

摘要

在大语言模型(LLMs)的推理时扩展中,密集的过程奖励已被证明是比稀疏的结果级奖励更有效的替代方案,特别是在需要复杂多步推理的任务中。虽然密集奖励也为大语言模型的强化学习(RL)提供了一个有吸引力的选择,因为其细粒度的奖励有可能解决结果奖励的一些固有问题,例如训练效率和信用分配,但这种潜力在很大程度上仍未实现。这主要归因于在线训练过程奖励模型(PRMs)的挑战,其中收集高质量的过程标签成本极其高昂,使得它们特别容易受到奖励黑客攻击。为了应对这些挑战,我们提出了 PRIME(通过隐式奖励进行过程强化),该方法仅使用策略展开和结果标签,通过隐式过程奖励实现 PRM 的在线更新。PRIME 与各种优势函数结合良好,并且省去了现有方法所需的专用奖励模型训练阶段,从而大幅降低了开发开销。我们展示了 PRIME 在竞赛数学和编程上的有效性。从 Qwen2.5-Math-7B-Base 开始,PRIME 在几个关键推理基准上比 SFT 模型平均提高了 15.1%。值得注意的是,我们得到的模型 Eurus-2-7B-PRIME 在七个推理基准上超越了 Qwen2.5-Math-7B-Instruct,而仅使用了其 10% 的训练数据。

关键词

引用

@article{arxiv.2502.01456,
  title  = {Process Reinforcement through Implicit Rewards},
  author = {Ganqu Cui and Lifan Yuan and Zefan Wang and Hanbin Wang and Yuchen Zhang and Jiacheng Chen and Wendi Li and Bingxiang He and Yuchen Fan and Tianyu Yu and Qixin Xu and Weize Chen and Jiarui Yuan and Huayu Chen and Kaiyan Zhang and Xingtai Lv and Shuo Wang and Yuan Yao and Xu Han and Hao Peng and Yu Cheng and Zhiyuan Liu and Maosong Sun and Bowen Zhou and Ning Ding},
  journal= {arXiv preprint arXiv:2502.01456},
  year   = {2025}
}

备注

24 pages. Model&Code&Data available at https://github.com/PRIME-RL/PRIME