中文

预测引导向量的有效性

机器学习 2026-04-20 v1 计算与语言

摘要

引导向量对某些概念和层有效,但对其他则无效,且实践者在运行干预前无法预测哪种设置适用。我们引入了线性可访问性概貌(LAP),这是一种逐层诊断工具,将 logit lens 重新用作引导向量有效性的预测器。关键度量 AlinA_{\mathrm{lin}} 将模型的 unembedding 矩阵应用于中间隐藏状态,无需训练。在五个模型(从 Pythia-2.8B 到 Llama-8B)上的 24 个受控二元概念族中,峰值 AlinA_{\mathrm{lin}} 预测引导有效性的相关系数为 ρ=+0.86\rho = +0.86+0.91+0.91,预测层选择的相关系数为 ρ=+0.63\rho = +0.63+0.92+0.92。一个三区域框架解释了均值差引导何时有效、何时需要非线性方法以及何时任何方法均无效。一个实体引导演示端到端地证实了该预测:在 LAP 推荐层进行引导可重定向 Gemma-2-2B 和 OLMo-2-1B-Instruct 上的补全,而中间层(标准启发式方法)对这两个模型均无影响。

关键词

引用

@article{arxiv.2604.15557,
  title  = {Predicting Where Steering Vectors Succeed},
  author = {Jayadev Billa},
  journal= {arXiv preprint arXiv:2604.15557},
  year   = {2026}
}

备注

19 pages, incl. 10 appendix pages, 4 figures, 20 tables