中文

无需真实过程标签的过程奖励模型训练方法FreePRM

计算与语言 2025-06-05 v1

摘要

近期大型语言模型(LLM)的进展表明,过程奖励模型(PRM)在增强模型性能方面发挥着关键作用。然而,训练PRM通常需要步骤级别的标签,要么是手动标注,要么是自动生成,这在规模化获取方面成本高昂且困难。为此,我们引入FreePRM,一个无需访问真实步骤标签的弱监督框架用于训练PRM。FreePRM首先根据最终结果的正确性生成伪步骤标签,然后利用缓冲概率消除伪标记固有噪声的影响。实验结果表明,FreePRM在ProcessBench上实现了53.0%的平均F1分数,优于在Math-Shepherd上获得完全监督的PRM提升+24.1%。与其他开源PRM相比,FreePRM相较于RLHFlow-PRM-Mistral-8B(28.4%)提升+24.6%,EurusPRM(31.3%)提升+21.7%,Skywork-PRM-7B(42.1%)提升+10.9%。本工作引入了PRM训练的新范式,显著减少了对高成本步骤级标注的依赖,同时保持了强大的性能。

关键词

引用

@article{arxiv.2506.03570,
  title  = {FreePRM: Training Process Reward Models Without Ground Truth Process Labels},
  author = {Lin Sun and Chuang Liu and Xiaofeng Ma and Tao Yang and Weijia Lu and Ning Wu},
  journal= {arXiv preprint arXiv:2506.03570},
  year   = {2025}
}