中文

关于《思考的错觉》的评论:将推理断崖重新框定为代理差距

人工智能 2025-06-25 v1 计算与语言 机器学习

摘要

Shojaee 等人(2025)的近期工作,标题为《思考的错觉:通过问题复杂性的视角理解推理模型的优势与局限》,提出了一个引人入胜的实证发现,即名为推理断崖的现象——在特定复杂性阈值之后,大型推理模型(LRMs)的性能会急剧下降,该作者将其视为链路思考(CoT)推理的内在尺度限制。尽管认可该研究的方法严谨性,但本评论认为该结论受到实验伪影的干扰。我们认为所观察到的失败并非认知边界的证据,而是静态、文本唯一评估范式中系统级约束的可预见结果,包括工具使用限制、上下文窗口记忆问题、缺乏关键认知基线、统计报告不足以及输出生成限制。我们通过代理差距的视角重新框定这种性能崩溃,断言这些模型并未在推理方面失败,而是在一个深刻限制性界面中的执行方面失败。我们通过实证研究予以证明:一款模型最初在仅限文本生成的情况下宣称该谜题不可能,现在则利用代理工具不仅解答了它,还掌握了该谜题在之前未能跨越的推理断崖之上的各种复杂性变体。此外,我们对工具启用模型(如 o4-mini 和 GPT-4o)的实证分析揭示了从简单程序执行到复杂元认知自我纠正的代理推理层级,这对我们如何定义和衡量机器智力具有重大意义。归因于 LRMs 的思考错觉,更多是推理缺陷,而是本应能够的思考者缺乏行动工具的结果。

关键词

引用

@article{arxiv.2506.18957,
  title  = {A Comment On "The Illusion of Thinking": Reframing the Reasoning Cliff as an Agentic Gap},
  author = {Sheraz Khan and Subha Madhavan and Kannan Natarajan},
  journal= {arXiv preprint arXiv:2506.18957},
  year   = {2025}
}

备注

10 pages, 2 figures, Comment on "The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity" (arXiv:2506.06941v1)