检测扰动:LLM 内省能力的细粒度视角
人工智能
2026-03-03 v2
摘要
大型语言模型是否能内省,即准确检测其内部状态的扰动?我们使用 Meta-Llama-3.1-8B-Instruct 对此问题进行系统性调查。首先,我们指出 prior work 中使用的二元检测范式掩盖了内省与方法性伪影: apparent 检测准确率完全归因于全局 logit 偏移,这些偏移会使模型在任何问题内容上都倾向于肯定回应。然而,在需要差别敏感性的任务上,我们发现模型具备部分内省能力:模型可达到最高 88% 的准确率定位 10 个句子中哪一个接受了注入(与 10% 随机机率相当),并能在 83% 的准确率下判别注入强度(与 50% 随机机率相当)。这些能力局限于早期层的注入,后期注入则退化至随机水平——我们通过注意力机制的信号路由与残差流恢复动力学对此进行了机械解释。我们的发现表明,LLM 能够对其内部状态的扰动计算有意义的函数,确立内省作为一种真实但依赖层次的现象,值得进一步探讨。我们的代码已开源:https://github.com/elyhahami18/llama-introspection-new
引用
@article{arxiv.2512.12411,
title = {Detecting the Disturbance: A Nuanced View of Introspective Abilities in LLMs},
author = {Ely Hahami and Ishaan Sinha and Lavik Jain and Josh Kaplan and Jon Hahami},
journal= {arXiv preprint arXiv:2512.12411},
year = {2026}
}
备注
7 pages (+ 4 pages for appendix), 5 figures, 2 tables