预测引导向量的有效性
机器学习
2026-04-20 v1 计算与语言
摘要
引导向量对某些概念和层有效,但对其他则无效,且实践者在运行干预前无法预测哪种设置适用。我们引入了线性可访问性概貌(LAP),这是一种逐层诊断工具,将 logit lens 重新用作引导向量有效性的预测器。关键度量 将模型的 unembedding 矩阵应用于中间隐藏状态,无需训练。在五个模型(从 Pythia-2.8B 到 Llama-8B)上的 24 个受控二元概念族中,峰值 预测引导有效性的相关系数为 至 ,预测层选择的相关系数为 至 。一个三区域框架解释了均值差引导何时有效、何时需要非线性方法以及何时任何方法均无效。一个实体引导演示端到端地证实了该预测:在 LAP 推荐层进行引导可重定向 Gemma-2-2B 和 OLMo-2-1B-Instruct 上的补全,而中间层(标准启发式方法)对这两个模型均无影响。
引用
@article{arxiv.2604.15557,
title = {Predicting Where Steering Vectors Succeed},
author = {Jayadev Billa},
journal= {arXiv preprint arXiv:2604.15557},
year = {2026}
}
备注
19 pages, incl. 10 appendix pages, 4 figures, 20 tables