用于图像识别的全局自注意力网络
计算机视觉与模式识别
2020-10-15 v2 机器学习
摘要
近来,计算机视觉领域的一系列工作利用自注意力在各种图像与视频理解任务上展示了有前景的结果。然而,由于自注意力的二次计算与内存复杂度,这些工作要么仅在深度网络后阶段对低分辨率特征图施加注意力,要么将每层的注意力感受野限制于小的局部区域。为克服这些局限,本文引入一种新的全局自注意力模块,称为 GSA 模块,其效率足以作为深度网络的骨干组件。该模块由两层并行组成:仅基于内容对像素施加注意力的内容注意力层,以及基于空间位置对像素施加注意力的位置注意力层。模块输出为两层输出之和。基于所提 GSA 模块,我们引入了新的独立全局基于注意力的深度网络,其使用 GSA 模块替代卷积来建模像素交互。由于所提 GSA 模块的全局性,GSA 网络具备在整个网络中建模长距离像素交互的能力。实验结果表明,在 CIFAR-100 与 ImageNet 数据集上,GSA 网络以更少的参数与计算量显著优于相应的基于卷积的网络。所提 GSA 网络在 ImageNet 数据集上也优于多种现有的基于注意力的网络。
引用
@article{arxiv.2010.03019,
title = {Global Self-Attention Networks for Image Recognition},
author = {Zhuoran Shen and Irwan Bello and Raviteja Vemulapalli and Xuhui Jia and Ching-Hui Chen},
journal= {arXiv preprint arXiv:2010.03019},
year = {2020}
}