中文

Couplformer:以耦合注意力图重新思考视觉Transformer

计算机视觉与模式识别 2021-12-13 v1

摘要

随着自注意力机制的发展,Transformer模型已在计算机视觉领域展现出卓越性能。然而,全注意力机制带来的海量计算成为内存消耗的沉重负担。随之而来的内存限制降低了改进Transformer模型的可能性。为补救该问题,我们提出一种名为Couplformer的新型内存经济注意力机制,其将注意力图解耦为两个子矩阵并从空间信息生成对齐分数。我们应用一系列不同尺度的图像分类任务来评估模型有效性。实验结果表明,在ImageNet-1k分类任务上,Couplformer相比常规Transformer可显著降低28%内存消耗,同时满足充足精度要求,并在占用相同内存足迹时以0.92%的优势超越Top-1准确率。因此,Couplformer可作为视觉任务中的高效骨干网络,并为研究者提供关于注意力机制的新视角。

关键词

引用

@article{arxiv.2112.05425,
  title  = {Couplformer:Rethinking Vision Transformer with Coupling Attention Map},
  author = {Hai Lan and Xihao Wang and Xian Wei},
  journal= {arXiv preprint arXiv:2112.05425},
  year   = {2021}
}

备注

11 pages, 4 figures