中文

内省意识的机制

机器学习 2026-05-18 v4

摘要

最近的工作表明,LLM 有时可以检测到注入其残差流中的驾驶向量,并识别被注入的概念——这被称为“内省意识”。我们研究了这种能力在开放权重模型中的机制。首先,我们发现这种能力是行为上稳健的:模型在多样化提示和对话格式下以 moderate 率检测注入的驾驶向量,错误阳性率为 0%。值得注意的是,这种能力特别源于后训练;我们表明偏好优化算法如 DPO 可以引发它,但标准的监督微调并不能。我们提供证据表明检测无法解释为驾驶向量与促进肯定响应方向之间的简单线性关联。我们将检测机制追溯到一个两阶段电路,其中“证据载体”特征在早期注入层单调地检测各种方向的扰动,抑制实施默认负面响应的下游“门”特征。这种电路在基础模型中不存在且对拒绝 ablation 稳健。最终层面的概念识别依赖于 largely 独立的后期层机制,这些机制仅与检测相关机制有弱重叠。最后,我们表明内省能力严重低于被激发:消除拒绝方向可使检测提高 +53%,训练的偏见向量可在不显著增加错误阳性的情况下使其在 held-out 概念上提高 +75%。我们的结果表明,这种对注入概念的内省意识是稳健且机制上不平凡的,并且在未来的模型中可以被大大放大。代码: https://github.com/safety-research/introspection-mechanisms

关键词

引用

@article{arxiv.2603.21396,
  title  = {Mechanisms of Introspective Awareness},
  author = {Uzay Macar and Li Yang and Atticus Wang and Peter Wallich and Emmanuel Ameisen and Jack Lindsey},
  journal= {arXiv preprint arXiv:2603.21396},
  year   = {2026}
}