中文

大型语言模型中的涌现内省意识

计算与语言 2026-01-06 v1 人工智能

摘要

我们探讨大型语言模型是否能对自身内部状态进行内省。仅凭对话很难回答此问题,因为真正的内省难以被与妄想区分。本文通过向模型激活中注入已知概念的表征,并测量这些操纵对模型自我报告状态的影响来应对这一挑战。我们发现,在某些情境下,模型能够察觉注入概念的存在并准确识别它们。模型展现出一定记忆先前内部表征的能力,并能将其与原始文本输入区分开来。令人瞩目的发现是:某些模型能够利用回忆先前意图的能力,以区分其自身输出与人工预填充。 在所有实验中,Claude Opus 4 和 4.1(我们测试的最强模型)通常展现出最强的内省意识;然而,模型间的趋势复杂且对后训练策略敏感。最后,我们探讨模型是否能显式控制其内部表征,发现模型在被指示或激励“思考”某个概念时能够调制其激活。总体而言,我们的结果表明当前语言模型具备对自身内部状态的某种功能性内省意识。我们强调,在当今模型中,这一能力高度不可靠且情境依赖;然而,随着模型能力的进一步提升,可能继续发展。

关键词

引用

@article{arxiv.2601.01828,
  title  = {Emergent Introspective Awareness in Large Language Models},
  author = {Jack Lindsey},
  journal= {arXiv preprint arXiv:2601.01828},
  year   = {2026}
}