中文

S2AFormer:面向高效 Vision Transformer 的条带自注意力

计算机视觉与模式识别 2025-12-01 v2

摘要

得益于其 token 混合器捕获所有 token 间全局依赖关系的复杂能力,Vision Transformer (ViT) 在计算机视觉领域取得了重大进展。然而,随着 token 数量的增加,计算需求呈二次级增长,限制了其实际效率。尽管最近的方法结合了卷积和自注意力的优势以实现更好的权衡,但自注意力中固有的昂贵成对 token 亲和力与复杂矩阵操作仍然是瓶颈。为了应对这一挑战,我们提出了 S2AFormer,一种具有新型条带自注意力的高效 Vision Transformer 架构。我们设计了简单而有效的混合感知块,将 CNN 的局部感知能力与 Transformer 注意力机制的全局上下文建模有效结合。SSA 的一个关键创新在于其降低了 KKVV 的空间维度,同时压缩了 QQKK 的通道维度。这种设计在保持精度的同时显著降低了计算开销,在效率与有效性之间取得了最佳平衡。我们通过在多个视觉基准上的大量实验评估了 S2AFormer 的鲁棒性和效率,包括用于图像分类的 ImageNet-1k、用于语义分割的 ADE20k,以及用于目标检测和实例分割的 COCO。结果表明,S2AFormer 在 GPU 和非 GPU 环境中均实现了显著的精度提升和卓越的效率,使其成为高效 Vision Transformer 的有力候选者。

关键词

引用

@article{arxiv.2505.22195,
  title  = {S2AFormer: Strip Self-Attention for Efficient Vision Transformer},
  author = {Guoan Xu and Wenfeng Huang and Wenjing Jia and Jiamao Li and Guangwei Gao and Guo-Jun Qi},
  journal= {arXiv preprint arXiv:2505.22195},
  year   = {2025}
}

备注

Accepted by IEEE-TIP, 14 pages, 8 figures, 9 tables