中文

基于大语言模型内部状态的“意识”能否被观察?——从 Theory of Mind 测试中分解 LLM 表示

密码学与安全 2025-07-01 v1 人工智能

摘要

整合信息理论(IIT)提供了一个定量框架,用于解释意识现象,认为有意识的系统由通过因果属性集成的要素构成。我们应用 IIT 3.0 和 4.0——该框架的最新版本——来分析大语言模型(LLM)表示的数据,这些数据源自现有的 Theory of Mind(ToM)测试结果。我们的研究系统性地检验 ToM 测试表现差异是否能通过 IIT 估计来揭示,即 Φmax\Phi^{\max}(IIT 3.0)、Φ\Phi(IIT 4.0)、概念信息(IIT 3.0)以及 Φ\Phi-结构(IIT 4.0)。此外,我们将这些指标与独立于任何意识估计的 Span Representations 进行比较。这一额外工作旨在区分潜在“意识”现象与 LLM 表示空间中固有的分离。我们进行了全面的实验,检查 LLM Transformer 各层和来自刺激的语言跨度之间的变化。我们的结果表明,现代基于 Transformer 的 LLM 表示在统计上缺乏对所观察“意识”现象的显著指示器,但在 spatio\textit{spatio}-permutational 分析下 exhibits 有趣的模式。附录和代码作为补充材料提供,链接为:https://doi.org/10.1016/j.nlp.2025.100163。

关键词

引用

@article{arxiv.2506.22515,
  title  = {In-context learning for the classification of manipulation techniques in phishing emails},
  author = {Antony Dalmiere and Guillaume Auriol and Vincent Nicomette and Pascal Marchand},
  journal= {arXiv preprint arXiv:2506.22515},
  year   = {2025}
}