SoLA-Vision:细粒度层级线性Softmax混合注意力
计算机视觉与模式识别
2026-01-19 v1
摘要
标准softmax自注意力在视觉任务中表现良好,但具有O(N^2)的二次复杂度,限制了在高分辨率上的部署。线性注意力将计算成本降低到O(N),但其压缩后的状态表征可能损害建模容量和准确性。我们提出了一项分析性研究,将线性注意力与softmax注意力在层堆叠视角下进行对比。我们进一步对层级混合化模式进行系统实验。我们的结果表明,与刚性块内混合设计相比,细粒度层级混合化能够在更少的softmax层数下实现相同或更好的性能。基于这些发现,我们提出SoLA-Vision(Softmax-Linear Attention Vision),一种灵活的层级混合注意力主干网络,使我们能够对线性注意力与softmax注意力的集成方式进行细粒度控制。通过战略性地插入少量全局softmax层,SoLA-Vision实现了准确性和计算成本之间的强大权衡。在ImageNet-1K上,SoLA-Vision超越了纯线性和其他混合注意力模型。在密集预测任务上,它持续地超越了强大的基准。代码将公开发布。
引用
@article{arxiv.2601.11164,
title = {SoLA-Vision: Fine-grained Layer-wise Linear Softmax Hybrid Attention},
author = {Ruibang Li and Guan Luo and Yiwei Zhang and Jin Gao and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:2601.11164},
year = {2026}
}
备注
Preprint