中文

思考更多总是有帮助吗?推理模型中测试时扩展的幻象

人工智能 2025-10-24 v3 计算与语言

摘要

推理模型(如 OpenAI o1、DeepSeek R1)在测试时扩展方面的最新趋势,导致了一种流行观点,即通过使用"等等"或"让我重新思考"等提示来扩展思考轨迹可以提升性能。这引发了一个自然的问题:在测试时进行更多思考是否真的能带来更好的推理?为了回答这个问题,我们在不同模型和基准测试上进行了详细的实证研究,揭示了一种持续的模式:额外的思考最初带来性能提升,随后由于"过度思考"而下降。为了理解这种非单调趋势,我们考虑了一个简单的概率模型,该模型揭示额外的思考增加了输出方差——制造了推理能力提升的幻觉,而最终损害了精确度。因此,观察到的"更多思考"带来的收益并非推理能力真正提升的指标,而是源于模型不确定性与评估指标之间关联的人为产物。这表明通过扩展思考进行测试时扩展并非有效利用推理预算的方法。认识到这些局限性,我们引入了一种替代的测试时扩展方法——并行思考,其灵感来自 Best-of-N 采样。我们的方法在相同的推理预算内生成多个独立的推理路径,并通过多数投票选择最一致的响应,与扩展思考相比实现了高达 20% 的准确率提升。这为推理模型的测试时扩展提供了一种简单而有效的机制。

关键词

引用

@article{arxiv.2506.04210,
  title  = {Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models},
  author = {Soumya Suvra Ghosal and Souradip Chakraborty and Avinash Reddy and Yifu Lu and Mengdi Wang and Dinesh Manocha and Furong Huang and Mohammad Ghavamzadeh and Amrit Singh Bedi},
  journal= {arXiv preprint arXiv:2506.04210},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025