视觉注意力网络
计算机视觉与模式识别
2022-07-12 v5
摘要
尽管自注意力机制最初为自然语言处理任务设计,其近期已席卷计算机视觉多个领域。然而,图像的二维本质给在计算机视觉中应用自注意力带来三个挑战。(1)将图像视为一维序列忽略了其二维结构。(2)二次复杂度对高分辨率图像过于昂贵。(3)其仅捕获空间适应性而忽略通道适应性。在本文中,我们提出一种称为大核注意力(LKA)的新型线性注意力,以在自注意力中实现自适应与长程关联,同时避免其缺陷。此外,我们呈现基于LKA的神经网络,即视觉注意力网络(VAN)。尽管极简,VAN在包括图像分类、目标检测、语义分割、全景分割、姿态估计等多任务中超越同规模视觉Transformer(ViT)与卷积神经网络(CNN)。例如,VAN-B6在ImageNet基准上达到87.8%准确率,并为全景分割树立新最先进性能(58.2 PQ)。此外,VAN-B2在ADE20K基准语义分割上超越Swin-T 4% mIoU(50.1对46.1),在COCO数据集目标检测上超越2.6% AP(48.8对46.2)。其为学界提供新方法及简单而强的基线。代码见 https://github.com/Visual-Attention-Network。
引用
@article{arxiv.2202.09741,
title = {Visual Attention Network},
author = {Meng-Hao Guo and Cheng-Ze Lu and Zheng-Ning Liu and Ming-Ming Cheng and Shi-Min Hu},
journal= {arXiv preprint arXiv:2202.09741},
year = {2022}
}
备注
Code is available at https://github.com/Visual-Attention-Network