中文

超越首个错误:面向反思性数学推理的过程奖励模型

人工智能 2025-05-21 v1

摘要

许多研究专注于训练有效 PRM 的数据标注技术。然而,当前方法在应用于长 CoT 推理过程时遇到了一个重大问题:它们往往只关注第一个错误步骤及之前的所有步骤,并假设后续所有步骤都是错误的。这些方法忽略了长 CoT 中固有的独特自我纠正和反思机制,其中在最初的推理错误之后仍可能出现正确的推理步骤。为了解决这个问题,我们提出了一种专门为长 CoT 推理过程评分的新型 PRM 数据标注方法。鉴于在反思模式下,正确和错误的步骤经常交替出现,我们引入了错误传播和错误停止的概念,增强了 PRM 识别有效自我纠正行为和基于错误步骤进行推理的能力。我们利用基于 LLM 的评判器进行标注,收集了 170 万个数据样本来训练 7B PRM,并在解答和步骤两个层面进行了评估。实验结果表明,与现有的开源 PRM 和在开源数据集上训练的 PRM 相比,我们的 PRM 在搜索引导、BoN 和 F1 分数等各种指标上均取得了更优的性能。与广泛使用的基于 MC 的标注方法相比,我们的标注方法不仅实现了更高的数据效率,还提供了更优的性能。我们还进行了详细分析,以证明我们方法的稳定性和泛化能力。

关键词

引用

@article{arxiv.2505.14391,
  title  = {Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning},
  author = {Zhaohui Yang and Chenghua He and Xiaowen Shi and Linjing Li and Qiyue Yin and Shihong Deng and Daxin Jiang},
  journal= {arXiv preprint arXiv:2505.14391},
  year   = {2025}
}