注意力的路由与过滤结构
机器学习
2026-05-20 v1 人工智能
摘要
注意力交互矩阵包含两种纠缠的计算:一种反对称分量在位置之间重新分配信息(路由),另一种对称分量缩放互相关性(过滤)。我们对5个预训练变压器模型中的1776个注意力头进行分解,发现路由在低秩下运行,远低于权重内核分配的路由容量。我们引入-注意力作为一种诊断参数化方法,通过保证稳定性()将路由与过滤构造性地解耦,并在无层归一化的情况下实现稳定训练。当解耦且无规范化时,路由自组织为谱级联,在第一层有效秩为2,随着深度在从7百万到355百万参数的6个尺度上扩展。级联预测注意力可被简化的地方:线性化125百万参数-注意力的前七层成本为困惑度,而标准注意力在相同干预下会崩溃。可线性化区域随深度扩大。用ELU+1线性注意力替换前四层,可在完全头维度下接近基线1.4%。级联分配的体系结构在换取困惑度方面出售注意力参数——在+3.9%至+8.4%困惑度(PPL)下,注意力参数减少47%至65%。路由-过滤分解使谱预算可见;级联使其可操作。
引用
@article{arxiv.2605.18826,
title = {The Routing and Filtering Structure of Attention},
author = {Shafayeth Jamil and Rehan Kapadia},
journal= {arXiv preprint arXiv:2605.18826},
year = {2026}
}
备注
13 pages, 7 figures