中文

GenPRM: 通过生成式推理扩展过程奖励模型的测试时间计算规模

计算与语言 2025-04-08 v2

摘要

近期大型语言模型 (LLM) 的进展表明,使用过程奖励模型 (PRM) 作为验证器可显著提升 LLM 的性能。然而,当前 PRM 面临三个关键挑战:(1) 过程监督和泛化能力有限,(2) 依赖标量值预测,未能发挥 LLM 的生成式能力,(3) 无法扩展 PRM 的测试时间计算。本文引入 GenPRM,一种生成式过程奖励模型,通过显式的链式思维 (CoT) 推理并进行代码验证后,再为每个推理步骤提供判断。为获得高质量的过程监督标签和 rationale 数据,我们提出了相对进度估计 (RPE) 和一种包含代码验证的 rationale 合成框架。在 ProcessBench 以及多个数学推理任务上的实验结果表明,GenPRM 只需 23K 来自 MATH 数据集的训练数据,便显著优于先前的 PRM。通过测试时间扩展,1.5B 参数的 GenPRM 超越 GPT-4o,7B 参数的 GenPRM 超过 Qwen2.5-Math-PRM-72B 在 ProcessBench 上。此外,GenPRM 在作为政策模型的批评模型方面表现出色。这项工作确立了一种新的过程监督范式,弥合了 PRM 与 LLM 中的批评模型之间的差距。我们的代码、模型和数据将发布于 https://ryanliu112.github.io/GenPRM。

关键词

引用

@article{arxiv.2504.00891,
  title  = {GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning},
  author = {Jian Zhao and Runze Liu and Kaiyan Zhang and Zhimu Zhou and Junqi Gao and Dong Li and Jiafei Lyu and Zhouyi Qian and Biqing Qi and Xiu Li and Bowen Zhou},
  journal= {arXiv preprint arXiv:2504.00891},
  year   = {2025}
}