揭示注意力中的斜线模式:RoPE 的作用
机器学习
2026-01-29 v2 人工智能
计算与语言
摘要
大型语言模型(LLMs)常表现出斜线注意力模式,即注意力得分集中在某个偏移量 的第 条次对角线上。这些模式在跨 token 传递信息中起关键作用。但它们为何会出现?在本文中,我们从经验和理论两个视角揭示了这些斜线主导头从何而来。首先,通过分析开源 LLMs,我们发现 SDHs 是模型固有的,且能泛化至分布外提示。为解释其固有涌现,我们分析了共同决定注意力得分的 queries、keys 和旋转位置编码。我们的经验分析揭示了 SDHs 的两个特征条件:(1) Queries 和 keys 几乎是秩一矩阵,(2) RoPE 由中高频分量主导。在这些条件下,各 token 间的 queries 和 keys 近乎相同,且 RoPE 中高频分量间的相互作用催生了 SDHs。除经验证据外,我们通过将这些条件形式化为建模假设,在理论上证明它们足以确保 SDHs 的涌现。具体而言,我们分析了在这些条件下配备 RoPE 的浅层 Transformer 的训练动态,并证明经梯度下降训练的模型会表现出 SDHs。该 SDHs 能泛化至分布外提示。
引用
@article{arxiv.2601.08297,
title = {Demystifying the Slash Pattern in Attention: The Role of RoPE},
author = {Yuan Cheng and Fengzhuo Zhang and Yunlong Hou and Cunxiao Du and Chao Du and Tianyu Pang and Aixin Sun and Zhuoran Yang},
journal= {arXiv preprint arXiv:2601.08297},
year = {2026}
}