中文

通过 Rubric Rewards 矫正 LLM 数学推理中的奇迹步骤

计算与语言 2026-04-20 v3

摘要

本文我们观察到当前模型容易受到奖励攻击,导致对模型推理能力的严重高估。这一现象通过大量假阳性结果得到证实——这些结果虽然得出正确答案,却通过不严谨的过程实现。通过对人类验证的系统性分析,我们建立了这些失败模式的分类体系,识别出诸如奇迹步骤(Miracle Steps)等模式,即在有效前导推导后直接跳转到正确输出。探索性实验表明,这些奇迹步骤与答案回忆快捷方式相关,包括来自预训练记忆,在模型独立于其推理链的情况下访问正确答案。为缓解这一系统性问题,我们引入了评分奖励模型(Rubric Reward Model, RRM),这是一种针对问题特定评估标准的过程导向奖励函数。RRM显式惩罚逻辑缺陷并鼓励严谨推演。在RL管道中集成RRM-based训练在四个数学基准测试中 consistently 优于仅基于结果的监督。值得注意的是,它将AIME2024上的Verified Pass@1024从26.7%提升至62.6%,并将奇迹步骤的发生率降低71%。我们的工作表明,奖励解决方案过程对于构建准确可靠的模型至关重要。

关键词

引用

@article{arxiv.2510.07774,
  title  = {Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards},
  author = {Youliang Yuan and Qiuyang Mang and Jingbang Chen and Hong Wan and Xiaoyuan Liu and Junjielong Xu and Jen-tse Huang and Wenxuan Wang and Wenxiang Jiao and Pinjia He},
  journal= {arXiv preprint arXiv:2510.07774},
  year   = {2026}
}

备注

Accepted by ACL 2026 Main, 22 pages, 10 figures, 7 Tables