面向无汇点、超稀疏和非弥散语言模型的阈值差分注意力
机器学习
2026-04-17 v2
摘要
Softmax 注意力在处理长上下文时面临困难,原因在于其结构限制:严格的归一化约束迫使注意力汇聚到不相关的标记上,并且随着序列长度增加,概率质量会弥散。我们通过阈值差分注意力(TDA)来解决这些问题,这是一种无汇点的注意力机制,能够在更长的序列长度上实现超稀疏性和更强的鲁棒性,而无需投影方法的计算开销,也避免了标准整流注意力因噪声累积导致的性能下降。TDA 应用逐行极值阈值处理,并配以长度相关的门控,仅保留超出阈值的部分。受差分 Transformer 的启发,TDA 还减去一个抑制视图以增强表达能力。理论上,我们证明了 TDA 能将每行虚假幸存者的期望数量控制在 ,并且随着上下文增长,跨独立视图的共识虚假匹配会消失。实验表明,TDA 产生 的精确零值并消除了注意力汇点,同时在标准和长上下文基准测试中保持了有竞争力的性能。
引用
@article{arxiv.2601.12145,
title = {Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling},
author = {Xingyue Huang and Xueying Ding and Mingxuan Ju and Yozen Liu and Neil Shah and Tong Zhao},
journal= {arXiv preprint arXiv:2601.12145},
year = {2026}
}