中文

大型语言模型中驾驶向量的非可识别性

机器学习 2026-04-02 v4 人工智能

摘要

激活驾驶方法广泛用于控制大型语言模型(LLM),且常被解释为揭示有意义的内部表示。这种解释假设驾驶方向是可识别且可从输入输出行为中唯一恢复的。我们表明,在白盒单层访问下,驾驶向量因存在大量在行为上不可区分的干预等价类而根本不可识别。实验上,我们发现正交扰动实现接近等效的效果,同时在多个模型和特征上产生可忽略的效应大小,并通过预训练语义分类器在输出层确认等效性。我们通过对激活协方差矩阵进行奇异值分解(SVD)来估计零空间维数,并验证等效性在操作上相关的驾驶范围内始终稳健。关键的是,我们表明非可识别性是一种稳健的几何性质,能够跨越多样化的提示分布而持久存在。这些发现揭示了基本的可解释性限制,凸显了超出行为测试的结构性约束对于实现可靠对齐干预的必要性。

关键词

引用

@article{arxiv.2602.06801,
  title  = {On the Non-Identifiability of Steering Vectors in Large Language Models},
  author = {Sohan Venkatesh and Ashish Mahendran Kurapath},
  journal= {arXiv preprint arXiv:2602.06801},
  year   = {2026}
}

备注

Code available at https://github.com/sohv/non-identifiability