GPT-2 中注意力汇的机制解释:单一回路及其对缓解的广泛启示
机器学习
2026-04-17 v1
摘要
Transformer 普遍表现出注意力汇现象:对第一个位置分配了不成比例的高注意力。我们在具有可学习查询偏置和绝对位置嵌入的 GPT-2 风格模型中研究了这一行为。结合结构分析与因果干预,并在自然语言、数学和代码输入上进行验证,我们发现该现象源于以下三者之间的相互作用:可学习的查询偏置、第一层 MLP 对位置编码的变换,以及键投影中的结构。关键在于,我们识别出的每个组件都是可单独缺省的:省略其中任何一个的架构都依然稳健地表现出注意力汇。这表明注意力汇可能在不同架构中通过截然不同的回路产生。这些发现为注意力汇的缓解提供了依据,并推动了对注意力汇为何产生的更广泛研究。
关键词
引用
@article{arxiv.2604.14722,
title = {A Mechanistic Account of Attention Sinks in GPT-2: One Circuit, Broader Implications for Mitigation},
author = {Yuval Ran-Milo and Hila Ofek and Shahar Mendel},
journal= {arXiv preprint arXiv:2604.14722},
year = {2026}
}
备注
9 pages, 8 figures