中文

超越驾驶向量:基于流的激活驾驶,用于推理时干预

计算与语言 2026-05-08 v1 机器学习

摘要

激活驾驶已成为控制语言模型在推理时行为的有前景的方法,通过修改中间表示来实现,而保持模型参数冻结。然而,大规模评估如 AxBench 表明,现有驾驶方法常被简单的人类学习提示所超越,并对未见概念的泛化能力较差。我们假设这些限制源于前述方法共享的未验证简化假设,这些假设通常将驾驶干预限制为固定、单步骤、位置不变的变换。我们提出 FLAS(基于流的激活驾驶),它学习一个通用的、概念条件化的速度场 vt(h,t,c)v_t(h,t,c) 将未驾驶的激活输送到驾驶后的激活,而无需依赖这些假设。在 AxBench 上,FLAS 是首个持续超越人类学习的方法,在 Gemma-2-2B-IT 和 Gemma-2-9B-IT 上分别达到了在持留样本中的调和平均值为 1.0151.0151.1131.113,无需 per-concept 调优。对所学习流的分析显示曲线、多步骤、token 可变的轨迹,这表明关于激活空间几何的先前假设可能不完整。

关键词

引用

@article{arxiv.2605.05892,
  title  = {Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention},
  author = {Zehao Jin and Ruixuan Deng and Junran Wang and Xinjie Shen and Chao Zhang},
  journal= {arXiv preprint arXiv:2605.05892},
  year   = {2026}
}