打破线性注意力的低秩困境
计算机视觉与模式识别
2025-03-12 v5
摘要
Transformer 模型中的 Softmax 注意力机制因其二次复杂度而计算成本高昂,这在视觉应用中带来了重大挑战。相比之下,线性注意力通过将复杂度降低到线性水平,提供了一种更高效的解决方案。然而,与 Softmax 注意力相比,线性注意力通常会出现显著的性能下降。我们的实验表明,这种性能下降是由于线性注意力特征图的低秩特性,这阻碍了其充分建模复杂空间信息的能力。在本文中,为了打破线性注意力的低秩困境,我们从 KV 缓冲区和输出特征两个角度进行了秩分析。据此,我们引入了秩增强线性注意力 (RALA),它在保持线性复杂度和高效率的同时,性能可与 Softmax 注意力相媲美。基于 RALA,我们构建了秩增强视觉线性 Transformer (RAVLT)。大量实验表明,RAVLT 在各种视觉任务中均取得了优异的性能。具体来说,在训练期间不使用任何额外标签、数据或监督的情况下,RAVLT 仅用 26M 参数和 4.6G FLOPs 就在 ImageNet-1k 上达到了 84.4% 的 Top-1 准确率。这一结果显著超越了以往的线性注意力机制,充分展示了 RALA 的潜力。代码将开源在 https://github.com/qhfan/RALA。
引用
@article{arxiv.2411.07635,
title = {Breaking the Low-Rank Dilemma of Linear Attention},
author = {Qihang Fan and Huaibo Huang and Ran He},
journal= {arXiv preprint arXiv:2411.07635},
year = {2025}
}
备注
The paper is accepted by CVPR2025