中文

权重更新即激活偏移:一种驾驭的原则框架

机器学习 2026-03-09 v2

摘要

激活驾驶承诺是一种极其参数高效的调整方式,但其有效性取决于关键设计选择——例如干预位置和参数化——这些选择目前依赖于经验法则而非原则性基础。我们在激活空间干预与权重空间更新之间建立了一阶等价,推导出激活驾驶能够复制微调行为的条件。这种等价性提供了驾驶设计的原则框架,并确定 post-block 输出作为理论上得到支持且高度表达的干预位置。我们进一步解释了为何某些干预位置优于其他位置,并指出权重更新与激活更新在功能上发挥着 distinct、互补的作用。该分析激励了一种新方法——联合适应——同时在两个空间中进行训练。我们的 post-block 驾驶在各种任务和模型上平均实现了距离完整参数调优仅 0.2%-0.9%$ 的准确率,同时仅训练 0.04% 的模型参数。它持续优于包括 LoRA 在内的先前激活驾驶方法,如 ReFT 和 PEFT 方法,同时使用显著更少的参数。最后,我们展示了联合适应常常超越了权重和激活更新单独达到的性能上限,引入了一种高效模型适应的新范式。

关键词

引用

@article{arxiv.2603.00425,
  title  = {Weight Updates as Activation Shifts: A Principled Framework for Steering},
  author = {Dyah Adila and John Cooper and Alexander Yun and Avi Trost and Frederic Sala},
  journal= {arXiv preprint arXiv:2603.00425},
  year   = {2026}
}