AI 中的自省现象是内容无关的
人工智能
2026-04-08 v2 计算与语言
摘要
自省是一种基础认知能力,但其机制尚不明了。最近的研究表明,AI 模型能够进行自省。我们研究了这种自省的机制。首先,我们在大型开源模型中广泛复现 Lindsey (2025) 的思想注入检测范式。我们展示了这些模型的自省是内容无关的:即使模型无法可靠地识别异常内容,仍然可以检测到异常发生。模型会生成被注入概念的扭曲想象,这些概念具有高频性和具体性(例如“苹果”)。此外,模型检测注入所需的 token 数也少于猜测正确概念所需的 token 数(错误猜测会更早出现)。我们认为,内容无关的自省机制与哲学和心理学中的主要理论一致。
引用
@article{arxiv.2603.05414,
title = {Emergent Introspection in AI is Content-Agnostic},
author = {Harvey Lederman and Kyle Mahowald},
journal= {arXiv preprint arXiv:2603.05414},
year = {2026}
}
备注
This version supersedes the earlier posted preprint, as discussed in this version