中文

别想太多:2+3=?——论类o1大语言模型的过度思考

计算与语言 2025-02-04 v2

摘要

OpenAI o1等模型的卓越性能可归因于其在推理过程中模拟人类长时间思考的能力。这些模型采用扩展的思维链(CoT)过程,探索多种策略以增强问题解决能力。然而,一个关键问题仍然存在:如何在测试阶段智能且高效地扩展计算资源。本文首次全面研究了这些模型中普遍存在的过度思考问题,即对简单问题分配过多计算资源而收益甚微。我们从结果和过程两个角度引入新的效率指标,以评估类o1模型对计算资源的合理使用。利用自训练范式,我们提出了缓解过度思考的策略,在不牺牲准确性的前提下简化推理过程。实验结果表明,我们的方法成功降低了计算开销,同时在GSM8K、MATH500、GPQA和AIME等不同难度级别的测试集上保持了模型性能。

关键词

引用

@article{arxiv.2412.21187,
  title  = {Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs},
  author = {Xingyu Chen and Jiahao Xu and Tian Liang and Zhiwei He and Jianhui Pang and Dian Yu and Linfeng Song and Qiuzhi Liu and Mengfei Zhou and Zhuosheng Zhang and Rui Wang and Zhaopeng Tu and Haitao Mi and Dong Yu},
  journal= {arXiv preprint arXiv:2412.21187},
  year   = {2025}
}

备注

We have updated the results of DeepSeek-R1, and all conclusions still hold