中文

傲慢行为在注意力头中线性隐藏

计算与语言 2026-01-26 v1 人工智能

摘要

我们发现,正确到错误的傲慢信号在多头注意力激活中最容易被线性分离。受线性表示假设的启发,我们在残差流、多层感知器 (MLP) 和注意力层上训练线性探针来分析这些信号出现的地方。虽然分离性在残差流和 MLP 中出现,但使用这些探针进行引导在稀疏的中间注意力头子集中最为有效。在以 TruthfulQA 为基础数据集的情况下,我们发现在其上训练的探针能够有效地迁移到其他事实性 QA 基准测试中。此外,比较我们发现的方向与先前识别的“truthful”方向之间的重叠性有限,表明事实准确性和抗傲望性源于相关但独立的机制。注意力图模式分析进一步表明,影响性较大的头注意力不成比例地关注用户怀疑的表达,导致傲望性转变。总体而言,这些发现表明,可以通过利用注意力激活内部几何的简单、有针对性的线性干预来缓解傲望行为。

关键词

引用

@article{arxiv.2601.16644,
  title  = {Sycophancy Hides Linearly in the Attention Heads},
  author = {Rifo Genadi and Munachiso Nwadike and Nurdaulet Mukhituly and Hilal Alquabeh and Tatsuya Hiraoka and Kentaro Inui},
  journal= {arXiv preprint arXiv:2601.16644},
  year   = {2026}
}