中文

可导向但不可解码:函数向量在 logit 透镜之外运作

机器学习 2026-05-12 v2

摘要

激活转向预设与任务相关的行为对应于激活空间中的线性方向——这些方向应既能导向模型,又能在反嵌入中可读。函数向量(FVs),作为 ICL 示范间的均值差异提取,是经典的测试案例;预测:导向与解码要么同时成功,要么同时失败。在 12 个任务、3 个家族的 6 个模型以及 4,032 个有向跨模板配对中,我们发现了相反的结果。FV 导向在 logit 透镜无法在任何中间层解码正确答案的地方 routinely 成功,而反向情况——可解码但不可导向——几乎为空(72 个中仅 3 个)。这一差距并非表示性方言的问题。对角调谐透镜闭合了 14 个可导向但不可解码案例中的 1 个;带有 Hewitt 与 Liang 控制的 2 层 MLP 探测器通过非线性编码结构闭合了 10 个中的 5 个,但使 5 个对所有被测试的解码器均不可见。即使在 > 0.90 的导向准确率下,通过反嵌入投影 FV 仍产生不连贯的 token 分布:FVs 编码的是计算指令,而非答案方向。模型家族的不对称性使图景更加清晰。Mistral 的 FVs 重写中间表示,而 Llama 和 Gemma 的 FVs 导向最终输出而不留下 logit 透镜可见的迹,这一结论得到三个信号的支持(导向后增量、激活修补恢复、FV 范数转移相关性)。之前报道的负余弦转移相关性在大规模下消失,在任务身份之外最多增加 ΔR2=0.011\Delta R^2 = 0.011。这些结果将线性表示假设分解为线性可解码性和线性可导向性,并表明它们与直觉相反地分离,对安全监控具有启示意义:词汇投影工具对广泛部署的模型家族中的 FV 风格干预是盲的。

关键词

引用

@article{arxiv.2604.02608,
  title  = {Steerable but Not Decodable: Function Vectors Operate Beyond the Logit Lens},
  author = {Mohammed Suhail B Nadaf},
  journal= {arXiv preprint arXiv:2604.02608},
  year   = {2026}
}

备注

43 pages, 14 figures, 34 tables