中文

非线性的补丁:大语言模型中的指令向量

计算与语言 2026-02-10 v1

摘要

尽管指令微调语言模型最近取得了成功并被广泛使用,但关于模型如何在内部处理指令,我们知之甚少。在这项工作中,我们从机制的角度解决了这一空白,通过研究指令特定表示如何在微调的不同阶段(监督微调(SFT)和直接偏好优化(DPO))被构建和利用。通过因果中介分析,我们识别出指令表示在模型中相当局部化。这些表示,我们称之为指令向量(IVs),展示了线性可分性与非线性因果相互作用的有趣并置,这广泛地质疑了机制可解释性中常见的线性表示假设的范围。为了解开非线性因果相互作用,我们提出了一种新颖的方法来定位语言模型中的信息处理,该方法不受基于补丁技术中隐含的线性假设的限制。我们发现,以早期层中形成的任务表示为条件,在后期层中选择不同的信息路径来解决该任务,即 IVs 充当电路选择器。

关键词

引用

@article{arxiv.2602.07930,
  title  = {Patches of Nonlinearity: Instruction Vectors in Large Language Models},
  author = {Irina Bigoulaeva and Jonas Rohweder and Subhabrata Dutta and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2602.07930},
  year   = {2026}
}