中文

Double-Checker:通过自关键微调增强慢思考LLM的推理能力

计算与语言 2025-10-03 v3

摘要

虽然慢思考型大语言模型(LLM)表现出类似反思的推理能力,常被称为"aha时刻",但其生成信息性批评并完善先前解决方案的能力仍有限。本文引入Double-Checker,一个原则性框架,旨在通过鼓励显式的自我批判和迭代细化来增强慢思考LLM的推理能力。通过在我们精选的1,730个自关键实例上进行微调,Double-Checker使长链CoT LLM能够在推理过程中不断批判和细化其输出,直到它们在自生成的批判下评估其解决方案为正确。我们在全面的推理基准测试中验证了Double-Checker的有效性,证明了迭代的自我批判显著增强了长链CoT LLM的推理能力。值得注意的是,Double-Checker将AIME基准测试中具有挑战性的pass@1性能从4.4%提升至18.2%。这些结果凸显了开发能够进行结构化自我批判的更可信且更有效的LLM的前景。我们的代码和数据已在https://github.com/XinXU-USTC/DoubleChecker 上提供。

关键词

引用

@article{arxiv.2506.21285,
  title  = {Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning},
  author = {Xin Xu and Tianhao Chen and Fan Zhang and Wanlong Liu and Pengxiang Li and Ajay Kumar Jaiswal and Yuchen Yan and Jishan Hu and Yang Wang and Hao Chen and Shiwei Liu and Shizhe Diao and Can Yang and Lu Yin},
  journal= {arXiv preprint arXiv:2506.21285},
  year   = {2025}
}

备注

10 pages