中文

重新思考思考的幻象

人工智能 2025-07-03 v1

摘要

今年年初,Apple 发布《思考的幻象》引发了激烈的 AI 社区争论。批评者将其发现解读为大型推理模型(LRM)缺乏真正推理能力的决定性证据,称其为纯粹的随机鸭子。与此同时,以 Lawsen 等人(2025)为代表的支持者则指责实验设计存在缺陷,结论过度。我们通过复制和细化原研究最具争议的两个基准:塔楼问题(Towers of Hanoi)和河流越狱(River Crossing),来阐明这场争论。通过引入逐步递进的提示和 agentic 协作对话,我们表明之前报告的解决塔楼问题的失败不仅源于输出限制,还部分源于认知局限:LRM 在复杂度提升至约8个盘子时仍会碰壁。此外,最初被视为灾难性失败的河流越狱结果,实际上依赖于测试不可解的配置。一旦将测试严格限制在可解问题范围内,LRM 能够轻松解决涉及超过100个 agent 对的大规模实例。我们的发现最终反驳了简单化的叙事:今天的 LRM 是离散状态空间中进行搜索的随机、RL 调优的代理人,我们几乎不理解其运作方式。实现符号化、长期推理的真实进展,需要通过像本文所介绍的细粒度消化研究之地来描绘这一领域。

关键词

引用

@article{arxiv.2507.01231,
  title  = {Rethinking the Illusion of Thinking},
  author = {Iñaki Dellibarda Varela and Pablo Romero-Sorozabal and Eduardo Rocon and Manuel Cebrian},
  journal= {arXiv preprint arXiv:2507.01231},
  year   = {2025}
}

备注

8 pages, 4 figures