右不足够: outcome监督训练LLM解题能力的陷阱
计算与语言
2025-06-25 v2
摘要
基于结果奖励的大语言模型(LLM)在数学问题解决方面展现出显著的成功,但这种成功往往掩盖了一个关键问题:模型常常通过根本不严谨的推理过程获得正确答案,这表现为奖励劫持现象。我们引入MathOlympiadEval,一个带有细粒度注释的数据集,揭示了LLM答案正确性与其低过程正确性之间的显著差距。现有的自动方法(如LLM作为裁判)难以可靠地检测到这些推理缺陷。为此,我们提出ParaStepVerifier,一种对数学解答进行细致逐步验证的新方法。ParaStepVerifier识别错误的推理步骤。实验结果表明,与基线方法相比,ParaStepVerifier在识别有缺陷解答方面显著提高了准确性,尤其是在复杂的多步骤问题方面。这为通往评估和训练拥有真正数学推理能力的LLM提供了更稳健的路径。
引用
@article{arxiv.2506.06877,
title = {Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning},
author = {Jiaxing Guo and Wenjie Yang and Shengzhong Zhang and Tongshan Xu and Lun Du and Da Zheng and Zengfeng Huang},
journal= {arXiv preprint arXiv:2506.06877},
year = {2025}
}