DC-W2S:基于双共识弱到强训练的可靠过程奖励建模方法
计算与语言
2026-03-10 v1 人工智能
机器学习
摘要
在科学推理任务中,推理过程的真实性与最终结果同等重要。虽然过程奖励模型(Process Reward Models, PRMs)提供了解决结果奖励模型(Outcome Reward Models, ORMs)中粗糙监督问题的方案,但其部署受限于获取专家验证的逐步标签所需的高昂成本。本文针对使用丰富但噪声较大的“弱”监督训练可靠PRMs的挑战展开研究。我们认为现有的弱到强泛化(Weak-to-Strong Generalization, W2SG)理论缺乏为从噪声数据中选择高质量训练信号的规范指导方针。为弥合这一鸿沟,我们提出了双共识弱到强(Dual-Consensus Weak-to-Strong, DC-W2S)框架。通过交集自我共识(Self-Consensus, SC)指标与嵌入空间中的邻域共识(Neighborhood-Consensus, NC)指标,我们将监督信号划分为不同的可靠性档次。随后,我们采用实例级平衡抽样与标签级可靠性感知掩码的课程训练,以引导训练过程。我们展示了DC-W2S能够在无需详尽专家标注的情况下训练出用于复杂推理的鲁棒PRMs,证明战略性数据精选比在大规模噪声数据集上进行不加筛选的训练更为有效。
引用
@article{arxiv.2603.08095,
title = {DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning},
author = {Chi-Min Chan and Ehsan Hajiramezanali and Xiner Li and Edward De Brouwer and Carl Edwards and Wei Xue and Sirui Han and Yike Guo and Gabriele Scalia},
journal= {arXiv preprint arXiv:2603.08095},
year = {2026}
}