中文

注意力的路由与过滤结构

机器学习 2026-05-20 v1 人工智能

摘要

注意力交互矩阵QKQK^{\top}包含两种纠缠的计算:一种反对称分量在位置之间重新分配信息(路由),另一种对称分量缩放互相关性(过滤)。我们对5个预训练变压器模型中的1776个注意力头进行分解,发现路由在低秩下运行,远低于权重内核分配的路由容量。我们引入SS-DD注意力作为一种诊断参数化方法,通过保证稳定性(Re(λ)0\mathrm{Re}(\lambda) \le 0)将路由与过滤构造性地解耦,并在无层归一化的情况下实现稳定训练。当解耦且无规范化时,路由自组织为谱级联,在第一层有效秩为2,随着深度在从7百万到355百万参数的6个尺度上扩展。级联预测注意力可被简化的地方:线性化125百万参数SS-DD注意力的前七层成本为<5%{<}5\%困惑度,而标准注意力在相同干预下会崩溃。可线性化区域随深度扩大。用ELU+1线性注意力替换前四层,可在完全头维度下接近基线1.4%。级联分配的体系结构在换取困惑度方面出售注意力参数——在+3.9%至+8.4%困惑度(PPL)下,注意力参数减少47%至65%。路由-过滤分解使谱预算可见;级联使其可操作。

关键词

引用

@article{arxiv.2605.18826,
  title  = {The Routing and Filtering Structure of Attention},
  author = {Shafayeth Jamil and Rehan Kapadia},
  journal= {arXiv preprint arXiv:2605.18826},
  year   = {2026}
}

备注

13 pages, 7 figures