中文

细粒度激活引导:少干预多获得

计算与语言 2026-02-05 v1

摘要

激活引导已成为修改大型语言模型(LLM)行为的高性价比方法。现有方法通常在块级进行干预,对选定注意力头、前馈网络或残差流的捆绑激活进行引导。然而,我们揭示块级激活本质上是异构的,纠缠了有益、无关和有害特征,从而使块级引导变得粗糙、低效且侵入性。为调查根本原因,我们将块级激活分解为细粒度原子单元(atomic unit, AU)级别的激活,其中每个AU级别的激活对应于块激活的单个维度,每个AU代表块权矩阵的一个切片。对AU级别的激活进行引导等同于对其关联的AU进行引导。我们的理论和实证分析表明,异构性源于不同AU或维度控制LLM输出中不同token分布。因此,块级引导必然同时移动有益和有害token方向,从而降低效率。限制在有益AU上的干预可实现更精确和更有效的引导。基于这一洞见,我们提出了一种简单且高效的方法,在AU级别上进行细粒度引导。AUSteer首先通过计算对比样本上的激活动量来全局识别判别性AU,然后为不同输入和所选AU激活分配自适应的引导强度。在多个LLM和任务上的全面实验表明,AUSteer在引导显著更少的激活的情况下,始终超过先进的基线,显示出少干预多获得的效果。

关键词

引用

@article{arxiv.2602.04428,
  title  = {Fine-Grained Activation Steering: Steering Less, Achieving More},
  author = {Zijian Feng and Tianjiao Li and Zixiao Zhu and Hanzhang Zhou and Junlang Qian and Li Zhang and Jia Jim Deryl Chua and Lee Onn Mak and Gee Wah Ng and Kezhi Mao},
  journal= {arXiv preprint arXiv:2602.04428},
  year   = {2026}
}

备注

ICLR 2026