中文

潜在内省:模型检测先验概念注入

人工智能 2026-02-27 v2 机器学习

摘要

我们发现 Qwen 32B 模型具备潜在的内省能力,证明该模型能够检测早期上下文中概念被注入的情况,并识别具体注入了哪个概念。尽管在抽样输出中模型否认注入,但通过 logit 镜头分析可在残差流中清晰捕获检测信号,这些信号在后期层中被削弱。此外,仅通过对 AI 内省机制的准确信息引导,即可显著强化这一效应:灵敏度大幅提升(从 0.3% 增至 39.9%),误报率仅增加 0.6%。此外,九个被注入且被恢复的概念之间的互信息从 0.61 位提升至 1.05 位,排除了噪声解释。我们的结果表明,模型具备被低估的内省与意识能力,对潜在推理与安全具有深远影响。

关键词

引用

@article{arxiv.2602.20031,
  title  = {Latent Introspection: Models Can Detect Prior Concept Injections},
  author = {Theia Pearson-Vogel and Martin Vanek and Raymond Douglas and Jan Kulveit},
  journal= {arXiv preprint arXiv:2602.20031},
  year   = {2026}
}

备注

28 pages, 17 figures. Submitted to ICML 2026. Workshop version submitted to ICLR 2026 Workshop on Latent and Implicit Thinking