中文

源头控制:面向稳健人格控制的风格调制注意力头

计算与语言 2026-05-29 v2 人工智能 计算机与社会

摘要

激活引导(activation steering)为控制大型语言模型(LLM)提供了一种计算高效的机制,无需微调。虽然在有效控制目标特性(如人格)方面表现良好,但仍面临一致性退化为主要障碍,制约了安全与实际部署。我们假设,这种退化源于对残差流进行干预,导致对聚合特征的无差别干扰,并无意中放大了非目标噪声。本文我们识别出一类稀疏注意力头(仅三组头)独立支配人格与风格的形成,这些头我们称为风格调制头(Style Modulation Heads)。具体而言,这些头可通过几何分析内部表征来定位,结合层级余弦相似性与头级贡献得分。我们展示,针对仅这些特定头进行干预,可实现稳健的行为控制,同时显著缓解残差流引导中观察到的一致性退化。更广泛地说,我们的发现表明,精确的组件级定位能够实现更安全、更精确的模型控制。

关键词

引用

@article{arxiv.2603.13249,
  title  = {Steering at the Source: Style Modulation Heads for Robust Persona Control},
  author = {Yoshihiro Izawa and Gouki Minegishi and Koshi Eguchi and Sosuke Hosokawa and Kenjiro Taura},
  journal= {arXiv preprint arXiv:2603.13249},
  year   = {2026}
}

备注

8 main pages with appendix