中文

SAGA:面向高效且富有表现力的线性注意力的选择性自适应门控

计算机视觉与模式识别 2026-03-10 v2

摘要

尽管 Transformer 架构在建模长程依赖关系方面表现出色,使其在视觉任务中得到广泛应用,但基于 softmax 的注意力机制的二次复杂度构成了一个主要瓶颈,尤其是在处理高分辨率图像时。线性注意力通过将注意力计算从 (QK)V(QK)V 重新表述为 Q(KV)Q(KV),从而将复杂度从 O(N2)\mathcal{O}(N^2) 降低到 O(N)\mathcal{O}(N),同时保留了全局感受野,提供了一种有前景的替代方案。然而,现有方法大多均匀地压缩历史键值 (KV) 信息,这可能导致特征冗余以及与查询 (Q) 的方向对齐性丧失。这种均匀压缩导致低秩的 KVKV 特征图,从而造成与 softmax 注意力相比的性能差距。为缓解这一局限性,我们提出了面向高效且富有表现力的线性注意力的\textbf{S}elective \textbf{A}daptive \textbf{GA}ting (SAGA),它引入了输入自适应的可学习门控,以选择性地调制信息聚合到 KVKV 特征图中的过程。这些门控增强了语义多样性,并缓解了传统线性注意力固有的低秩约束。此外,我们提出了一种用于门控计算的高效 Hadamard 乘积分解方法,该方法不会引入额外的内存开销。实验表明,在 1280×12801280 \times 1280 分辨率下,与 PVT-T 相比,SAGA 的吞吐量提升了 1.76 倍,GPU 峰值内存降低了 2.69 倍。此外,它在 ImageNet 数据集上将 top-1 准确率最高提升了 4.4%,同时展示了计算效率和模型有效性。

关键词

引用

@article{arxiv.2509.12817,
  title  = {SAGA: Selective Adaptive Gating for Efficient and Expressive Linear Attention},
  author = {Yuan Cao and Dong Wang},
  journal= {arXiv preprint arXiv:2509.12817},
  year   = {2026}
}