中文

AI 中的自省现象是内容无关的

人工智能 2026-04-08 v2 计算与语言

摘要

自省是一种基础认知能力,但其机制尚不明了。最近的研究表明,AI 模型能够进行自省。我们研究了这种自省的机制。首先,我们在大型开源模型中广泛复现 Lindsey (2025) 的思想注入检测范式。我们展示了这些模型的自省是内容无关的:即使模型无法可靠地识别异常内容,仍然可以检测到异常发生。模型会生成被注入概念的扭曲想象,这些概念具有高频性和具体性(例如“苹果”)。此外,模型检测注入所需的 token 数也少于猜测正确概念所需的 token 数(错误猜测会更早出现)。我们认为,内容无关的自省机制与哲学和心理学中的主要理论一致。

关键词

引用

@article{arxiv.2603.05414,
  title  = {Emergent Introspection in AI is Content-Agnostic},
  author = {Harvey Lederman and Kyle Mahowald},
  journal= {arXiv preprint arXiv:2603.05414},
  year   = {2026}
}

备注

This version supersedes the earlier posted preprint, as discussed in this version