中文

驾驭意识:从内部检测激活驾驶

计算与语言 2026-03-20 v3 人工智能

摘要

激活驾驶——将向量添加到模型残差流中以修改其行为——在安全评估中广泛用于假设模型无法检测干预。我们检验了这一假设,引入驾驶意识:模型在自身前向传播期间推断出是否注入了驾驶向量以及其编码何种概念的能力。在微调后,七个指令调优模型在持久化概念上展现出强大的驾驶意识;最佳模型达到 95.5% 检测率、71.2% 概念识别率,并在干净输入上实现零误报。这种能力对未见的驾驶向量构建方法具有普遍性,但仅当其方向与训练分布的余弦相似度较高时;否则则不然,这表明这是一种几何检测器而非通用异常检测器。令人惊讶的是,检测并不赋予抗性;在事实和安全基准测试中,检测训练的模型在可被驾驶的程度上始终高于其基线模型。机制上讲,驾驶意识并非源自局部电路,而是来自一种分布式转换,逐步将多样化的注入向量旋转到共享的检测方向。因此,激活驾驶不应被视为安全评估中的不可见干预。

关键词

引用

@article{arxiv.2511.21399,
  title  = {Steering Awareness: Detecting Activation Steering from Within},
  author = {Joshua Fonseca Rivera and David Demitri Africa},
  journal= {arXiv preprint arXiv:2511.21399},
  year   = {2026}
}