中文

教会大型推理模型进行有效反思

人工智能 2026-01-21 v1

摘要

大型推理模型近期在复杂推理任务上展现出令人印象深刻的性能,通常通过参与自我反思行为,如自我批评和回溯。然而,并非所有反思都是有益的——许多反思是肤浅的,对原始答案几乎没有改进,并带来计算开销。在本文中,我们识别并解决了大型推理模型中肤浅反思的问题。我们首先提出自我批评微调,一个仅使用模型自身生成的批评来增强模型反思推理能力的训练框架。自我批评微调促使模型批评自身输出,通过拒绝采样过滤高质量批评,并使用基于批评的目标对模型进行微调。在此坚实基础上,我们进一步引入带有效反思奖励的强化学习。带有效反思奖励的强化学习利用由自我批评微调初始化的高质量反思来构建奖励信号,通过强化学习引导模型内化自我纠正过程。在两个具有挑战性的基准AIME2024和AIME2025上的实验表明,自我批评微调和带有效反思奖励的强化学习显著提高了推理准确性和反思质量,超越了最先进的基线方法。所有数据和代码可在https://github.com/wanghanbinpanda/SCFT获取。

关键词

引用

@article{arxiv.2601.12720,
  title  = {Teaching Large Reasoning Models Effective Reflection},
  author = {Hanbin Wang and Jingwei Song and Jinpeng Li and Qi Zhu and Fei Mi and Ganqu Cui and Yasheng Wang and Lifeng Shang},
  journal= {arXiv preprint arXiv:2601.12720},
  year   = {2026}
}

备注

14 pages (including appendix), 5 figures