思考并非幻象:通过工具增强克服推理模型的局限性
人工智能
2025-07-24 v1
摘要
大规模推理模型(LRM)是今天大型语言模型(LLM)研究的核心焦点,其中设计的模型在到达最终答案之前输出逐步思考过程,以处理复杂推理任务。尽管具有前景,但近期实证研究(如来自 Apple 的 [Shojaee 等,2025])表明,这种思考过程实际上可能不增强推理能力,LLM 在低或高复杂度任务上表现不佳。本文重新审视了这些发现,探讨了在引入工具增强后,LRM 的局限性是否仍然存在。我们采用 Python 解释器和草稿纸两种工具,对三个代表性 LLM 及其 LRM 对等版本在 Apple 的推理谜题基准上进行评估。我们的结果表明,经过恰当的工具使用,LRM 在所有任务复杂度水平上均 consistently 优于其非推理对等版本。这些发现挑战了近期认为推理是幻象的叙述,凸显了工具增强 LRM 在解决复杂问题方面的潜力。
关键词
引用
@article{arxiv.2507.17699,
title = {Thinking Isn't an Illusion: Overcoming the Limitations of Reasoning Models via Tool Augmentations},
author = {Zhao Song and Song Yue and Jiahao Zhang},
journal= {arXiv preprint arXiv:2507.17699},
year = {2025}
}