中文

Norm$\times$Direction:恢复视觉线性注意力中的缺失查询范数

机器学习 2026-05-26 v3

摘要

线性注意力机制缓解了 softmax 注意力的二次时间复杂度,但因表达力损失而受到严重制约。我们识别出两大主要原因:(1)归一化操作抵消了查询范数,破坏了查询范数与注意力分布稀疏性(熵)之间的相关性,这一特性在 softmax 注意力中体现;(2)标准的非负性约束技术通过消除有效内积相互作用而造成信息破坏。为此,我们提出 NaLaFormer,一种基于查询和键向量的范数×\times方向(ND)分解的新型线性注意力机制。我们利用各分量解决不同问题:将查询范数注入核函数中,以创建查询范数感知映射,恢复注意力分布的稀疏性;方向向量通过几何、余弦基准的相似性度量加以处理,确保非负性的同时保留内积的丰富细粒度信息。我们通过多模态全面评估验证了 NaLaFormer,在线性注意力领域设定了新的最先进基准。该模型在 ImageNet-1K 上实现最高达 7.5% 的准确率提升,在ADE20K 上实现最高达 4.7% 的 mIoU 提升。其显示出显著的效率优势,在包含 7 万+ token 的超分辨率任务中峰值内存降低最高可达 92.3%。NaLaFormer 的通用性进一步通过在常见常识推理任务中超越 Mamba 等强大基线,以及在长程旅程竞赛(LRA)基准上设定新纪录得到确认。代码已公开于 https://github.com/ZacharyMeng/NaLaFormer。

关键词

引用

@article{arxiv.2506.21137,
  title  = {Norm$\times$Direction: Restoring the Missing Query Norm in Vision Linear Attention},
  author = {Weikang Meng and Yadan Luo and Liangyu Huo and Yingjian Li and Yaowei Wang and Xin Li and Zheng Zhang},
  journal= {arXiv preprint arXiv:2506.21137},
  year   = {2026}
}