Softmax线性注意力:恢复全局竞争
机器学习
2026-02-03 v1 人工智能
摘要
线性注意力将标准Transformer的二次复杂度降低为线性时间,却因去除softmax归一化而在表达性上常屈居于下。这一缺失消除了全局竞争机制——这是模型聚焦于长序列背景噪声中相关信息的关键手段。本文提出了Softmax线性注意力(SLA)框架,以恢复这种竞争选择,同时保持效率。通过将softmax操作从 token 级别提升至 head 级别,SLA将注意力头作为粗粒度语义槽位,施加竞争性门控机制,以动态选择最相关的子空间。这重新引入了"赢家为之"(winner-take-all)动力学,对于精准检索和稳健的长序列理解至关重要。与旨在细化局部核函数的先前方法不同,SLA采用更广泛的视角,利用更高层次的多头聚合结构。大量实验表明,SLA在语言建模和长序列基准测试中持续提升当前最先进的线性基线(RetNet、GLA、GDN),尤其在面对挑战性检索场景时显著增强了对噪声的鲁棒性,证明了其在保持线性复杂度的同时恢复精准聚焦的能力。
引用
@article{arxiv.2602.01744,
title = {Softmax Linear Attention: Reclaiming Global Competition},
author = {Mingwei Xu and Xuan Lin and Xinnan Guo and Wanqing Xu and Wanyun Cui},
journal= {arXiv preprint arXiv:2602.01744},
year = {2026}
}
备注
11 pages,4 figures