NeuroCogMap 揭示大型语言模型的认知组织
神经元与认知
2026-07-01 v1 人工智能
计算与语言
摘要
理解复杂认知功能如何在人工系统内组织,对于解释大型语言模型(LLM)并将其与生物认知联系起来至关重要。然而,尽管 LLM 表现出广泛的类似认知的行为,但其内部表示是否形成可复现的功能系统来解释行为、失败以及与人类认知的联系,仍不清楚。在此,我们提出了 NeuroCogMap,一个受认知神经科学启发的框架,将 LLM 的内部特征组织成功能分区,并将其与可解释的功能、认知能力和认知层级联系起来。这些分区形成一个稳定且语义连贯的组织,该组织在不同模型间部分保守,并与模型输出功能相关。在此组织内,主要的 LLM 失败,包括幻觉、偏见、拒绝失败和谄媚,对应于表示和行为控制系统中的不同干扰,为机制引导的检测和有针对性的干预提供了内部特征。除了模型行为之外,NeuroCogMap 还改善了对自然语言理解期间人类皮层反应的预测,在高级联想皮层中具有最强的对应关系。在认知层面,其内部特征揭示了潜在的策略,这些策略指导了对经典人类决策模型的改进。总之,这些发现确立了 NeuroCogMap 作为一个系统级框架,用于绘制人工系统中的功能组织,并将该组织与人类皮层功能和认知行为联系起来。
引用
@article{arxiv.2607.00397,
title = {NeuroCogMap Reveals Cognitive Organization of Large Language Models},
author = {Zhongxiang Sun and Haolang Lu and Qiang Ma and Qi Li and Qipeng Wang and Liang Pang and Chenyu Liu and Qiankun Li and Hao Sun and Kun Wang and Yi Zeng and Jun Xu and Guoqi Li and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2607.00397},
year = {2026}
}
备注
79 pages, 6 main figures, 5 extended figures