理解语言模型中导向向量的(不)可靠性
机器学习
2025-05-29 v1
摘要
导向向量是一种轻量级的方法,通过在推理时向激活值添加学习到的偏置来控制语言模型的行为。尽管导向展示了有前景的性能,但最近的工作表明它在某些情况下可能不可靠甚至适得其反。本文研究了提示类型和激活差异几何对导向可靠性的影响。首先,我们发现实验中使用的所有七种提示类型都产生了净正向的导向效果,但在不同样本间表现出高方差,并且经常产生与预期相反的效果。没有一种提示类型明显优于其他类型,然而不同提示类型产生的导向向量在方向上通常不同(通过余弦相似度衡量)。其次,我们表明训练集激活差异之间更高的余弦相似度预示着更有效的导向。最后,我们观察到正负激活值更好分离的数据集具有更高的可导向性。我们的结果表明,当目标行为无法由一个连贯的方向表示时,向量导向是不可靠的。
引用
@article{arxiv.2505.22637,
title = {Understanding (Un)Reliability of Steering Vectors in Language Models},
author = {Joschka Braun and Carsten Eickhoff and David Krueger and Seyed Ali Bahrainian and Dmitrii Krasheninnikov},
journal= {arXiv preprint arXiv:2505.22637},
year = {2025}
}
备注
17 pages, 10 figures. Presented at the ICLR 2025 Workshop on Foundation Models in the Wild