Couplformer:以耦合注意力图重新思考视觉Transformer
计算机视觉与模式识别
2021-12-13 v1
摘要
随着自注意力机制的发展,Transformer模型已在计算机视觉领域展现出卓越性能。然而,全注意力机制带来的海量计算成为内存消耗的沉重负担。随之而来的内存限制降低了改进Transformer模型的可能性。为补救该问题,我们提出一种名为Couplformer的新型内存经济注意力机制,其将注意力图解耦为两个子矩阵并从空间信息生成对齐分数。我们应用一系列不同尺度的图像分类任务来评估模型有效性。实验结果表明,在ImageNet-1k分类任务上,Couplformer相比常规Transformer可显著降低28%内存消耗,同时满足充足精度要求,并在占用相同内存足迹时以0.92%的优势超越Top-1准确率。因此,Couplformer可作为视觉任务中的高效骨干网络,并为研究者提供关于注意力机制的新视角。
引用
@article{arxiv.2112.05425,
title = {Couplformer:Rethinking Vision Transformer with Coupling Attention Map},
author = {Hai Lan and Xihao Wang and Xian Wei},
journal= {arXiv preprint arXiv:2112.05425},
year = {2021}
}
备注
11 pages, 4 figures