中文

过程奖励模型综述:从结果信号到大语言模型的过程监督

计算与语言 2026-04-30 v3 人工智能

摘要

虽然大语言模型(LLM)表现出先进的推理能力,但常规对齐方法仍主要依赖结果奖励模型(ORM),仅评判最终答案。过程奖励模型(PRMs)弥补了这一差距,通过在步骤或轨迹水平上评估和引导推理。本综述通过完整的闭环系统性概述 PRMs:如何生成过程数据、构建 PRMs 以及如何用于测试时扩展和强化学习。我们总结了在数学、代码、文本、多模态推理、机器人和智能体等领域的应用,并回顾了新兴基准。我们的目标是阐明设计空间,揭示开放挑战,并指引未来研究向细粒度、稳健的推理对齐方向发展。

关键词

引用

@article{arxiv.2510.08049,
  title  = {A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models},
  author = {Congmin Zheng and Jiachen Zhu and Zhuoying Ou and Yuxiang Chen and Kangning Zhang and Rong Shan and Zeyu Zheng and Mengyue Yang and Jianghao Lin and Yong Yu and Weinan Zhang},
  journal= {arXiv preprint arXiv:2510.08049},
  year   = {2026}
}