大语言模型理解的机理指示器
计算与语言
2026-02-26 v5 人工智能
摘要
大语言模型 (LLM) 常被描绘为仅模仿语言模式而不具备真正的理解能力。我们认为,随着机理可解释性 (MI) 这一新兴领域的发展,人们对 LLM 内部工作机制的认识日益完善——但仅凭这些发现还不足以构建对理解的理论阐释。我们提出了一种分层框架,用以思考 LLM 中的理解,并据此综合了迄今为止最相关的研究发现。该框架在三个层次上区分了不同的理解类型,每个层次都与相应的计算组织层级相关联:概念理解当模型在潜在空间中形成“特征”方向时出现,学习单个实体或属性的不同表现形式之间的联系;情境-世界理解当模型学习特征与世界状态之间的偶然性事实联系,并动态跟踪世界变化时出现;原则性理解当模型不再依赖记忆的事实,而是发现将这些事实相连的紧凑“电路”时出现。在这些层次中,MI 揭示了能够支撑类似理解的统一性内部组织。然而,这些组织也与人类认知在并行利用异构机制方面存在差异。将哲学理论与机理证据融合,使我们能够超越关于 AI 是否“理解”的二元争论,为一种比较的、以机理为基础的认识论铺路,探讨 AI 理解如何与我们的理解相吻合,又如何与之不同。
引用
@article{arxiv.2507.08017,
title = {Mechanistic Indicators of Understanding in Large Language Models},
author = {Pierre Beckmann and Matthieu Queloz},
journal= {arXiv preprint arXiv:2507.08017},
year = {2026}
}
备注
38 pages