推理认知基础及其在大语言模型中的表现
人工智能
2025-11-25 v2
摘要
大语言模型 (LLMs) 虽能解决复杂问题,却在简单变体中失败,暗示其正确输出是通过与人类推理截然不同的机制实现的。为理解这一差距,我们综合认知科学研究,构建了涵盖推理不变量、元认知控制、用于组织推理与知识的表征,以及转换操作的 28 项认知元素的分类体系。我们引入细粒度评估框架,对 18 个模型(涵盖文本、视觉和音频)获取的 19.2 万条推理�迹进行首次大规模实证分析,同时补充 54 条人类思维语音记录,我们将其公开分享。我们发现,模型在利用与成功相关的认知元素方面不足,导致其在结构问题上僵化地顺序处理,其中需要多样化表征和元认知监控的关键。人类思维记录显示更高的抽象和概念处理,而模型则默认进行表层枚举。对 1.6 万篇 LLM 推理论文的元分析揭示,研究社区集中注意力于易于量化的元素(顺序组织:55%,分解:60%),但忽略了与成功相关的元认知控制(自我意识:16%)。模型拥有与成功相关的行为 repertoire,但未能自发部署。基于这些模式,我们开发了测试时推理指导,自动搭建成功结构,使复杂问题性能提升最高可达 66.7%。通过建立认知科学与 LLM 研究之间的共享词汇,本框架实现对推理失效的系统诊断,为通过稳健认知机制而非偶然捷径发展模型提供原则性方法,同时提供大规模测试人类认知理论的工具。
引用
@article{arxiv.2511.16660,
title = {Cognitive Foundations for Reasoning and Their Manifestation in LLMs},
author = {Priyanka Kargupta and Shuyue Stella Li and Haocheng Wang and Jinu Lee and Shan Chen and Orevaoghene Ahia and Dean Light and Thomas L. Griffiths and Max Kleiman-Weiner and Jiawei Han and Asli Celikyilmaz and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2511.16660},
year = {2025}
}
备注
40 pages, 4 tables, 6 figures