中文

为何注意力模式存在:统一的 temporal 视角分析

计算与语言 2026-01-30 v1

摘要

注意力模式在大型语言模型(LLM)的训练和推理中发挥关键作用。先前的研究已识别了诸如检索头、sink头和对角线轨迹等individual patterns,但这些观察仍零散,缺乏统一的解释。为弥合这一差距,我们引入Temporal Attention Pattern Predictability Analysis(TAPPA),一个统一框架,通过从连续时间的角度分析其底层数学公式,解释多样化的注意力模式。TAPPA既深化了对注意力行为的理解,又指导了推理加速方法。具体而言,TAPPA将注意力模式表述为具有清晰规律性的可预测模式和实际上呈随机样子的不可预测模式。我们的分析进一步揭示,这一区分可由查询在时间维度上的自相似程度所解释。针对可预测模式,我们进一步通过查询、键以及Rotary Positional Embeddings(RoPE)的联合作用,对三个具有代表性的案例进行详细数学分析。我们通过将TAPPA的洞见应用于KV缓存压缩和LLM剪枝任务来验证TAPPA。在这些任务中,一个受TAPPA启发的简单度量标准在基线方法之上持续改进性能。代码可在 https://github.com/MIRALab-USTC/LLM-TAPPA 获取。

关键词

引用

@article{arxiv.2601.21709,
  title  = {Why Attention Patterns Exist: A Unifying Temporal Perspective Analysis},
  author = {Qingyue Yang and Jie Wang and Xing Li and Yinqi Bai and Xialiang Tong and Huiling Zhen and Jianye Hao and Mingxuan Yuan and Bin Li},
  journal= {arXiv preprint arXiv:2601.21709},
  year   = {2026}
}

备注

ICLR 2026