CoLD:面向数学推理的基于反事实引导的长度去偏框架
计算与语言
2026-05-20 v2 人工智能
机器学习
摘要
过程奖励模型(PRMs)在评估和引导大型语言模型(LLMs)中的多步骤推理中发挥着核心作用,尤其是用于数学问题解决。然而,我们识别出现有PRMs中普遍存在的长度偏差:它们倾向于为更长的推理步骤赋予更高分数,即使语义内容和逻辑有效性保持不变。这一偏差削弱了奖励预测的可靠性,导致推理输出过于冗长。在解决此问题方面,我们提出了CoLD(Counterfactually-Guided Length Debiasing),一个统一框架,通过三个组件消除长度偏见:显式的长度惩罚调整、学习到的偏差估计器(旨在捕捉与长度相关的虚线),以及强制奖励预测长度不变性的联合训练策略。我们的方法基于反事实推理,受到因果图分析的启发。大量实验表明,CoLD在步骤选择方面提高了准确率,鼓励更简洁、逻辑有效的推理。此外,它在改进下游RL性能方面始终如一地有效,并通过消除长度偏见实现跨领域泛化,证明了CoLD的强大泛化能力。
引用
@article{arxiv.2507.15698,
title = {CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning},
author = {Congmin Zheng and Jiachen Zhu and Jianghao Lin and Xinyi Dai and Weiwen Liu and Haoxuan Li and Yong Yu and Weinan Zhang and Mengyue Yang},
journal= {arXiv preprint arXiv:2507.15698},
year = {2026}
}