中文

基于蒙特卡罗信息增益的链式思考推理过程监督

计算与语言 2026-03-19 v1

摘要

多步骤推理提高了大型语言模型(LLM)的能力,但增加了错误在中间步骤中传播的风险。过程奖励模型(PRM)通过对每个步骤进行评分来缓解这一问题,实现细粒度监督并提高可靠性。现有训练PRM的方法依赖高成本的人工标注或计算密集的自动标注。我们提出一种新方法,通过信息论自动生成步骤级标签。该方法估计每个推理步骤对正确答案可能性的影响,提供步骤质量的信号。重要的是,它将计算复杂度降低到O(N)\mathcal{O}(N),优于以往的O(NlogN)\mathcal{O}(N \log N)方法。我们在包括数学、Python编程、SQL和科学问答等多样化推理基准测试中演示,这些标签可有效实现链式思考的最佳选择,在best-of-KK评估设置中表现良好。该工作为LLM推理的可扩展且高效的监督提供了可能,特别是在错误传播至关重要的任务中。

关键词

引用

@article{arxiv.2603.17815,
  title  = {Process Supervision for Chain-of-Thought Reasoning via Monte Carlo Net Information Gain},
  author = {Corentin Royer and Debarun Bhattacharjya and Gaetano Rossiello and Andrea Giovannini and Mennatallah El-Assady},
  journal= {arXiv preprint arXiv:2603.17815},
  year   = {2026}
}