DuaShepherd:融合逐步正确性与潜在奖励的数学推理
计算与语言
2025-06-24 v1
摘要
在本文中,我们提出DuaShepherd,一种新颖的奖励建模框架,它整合了两种互补的奖励信号——正确性和潜力——以增强大语言模型(LLMs)的数学推理能力。基于正确性的信号强调逐步错误的识别,而基于潜力的信号则关注达到正确最终答案的可能性。我们开发了一个自动化流水线,用于构建包含两种信号的大规模奖励建模数据集。探索了一种统一的多头架构,在多任务设置中训练两个奖励模型,展示了从并行学习正确性和潜力中获益。通过将这两种信号组合成一个复合概率,我们的模型在多个基准测试中实现了持续的性能提升。在MATH500和ProcessBench上的实证评估证实,这种组合奖励显著优于仅使用任一奖励类型训练的模型,在可比资源约束下达到了最先进的性能。
引用
@article{arxiv.2506.17533,
title = {DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning},
author = {Yuanhao Wu and Juntong Song and Hanning Zhang and Tong Zhang and Cheng Niu},
journal= {arXiv preprint arXiv:2506.17533},
year = {2025}
}