注意力增强的卷积网络
计算机视觉与模式识别
2020-09-11 v5
摘要
卷积网络已成为许多计算机视觉应用中的首选范式。然而卷积操作有一个显著弱点,即其仅在局部邻域内运作,从而缺失全局信息。另一方面,自注意力作为近期进展涌现以捕捉长程交互,但主要应用于序列建模与生成建模任务。本文中,我们考虑将自注意力用于判别性视觉任务,作为卷积的替代方案。我们引入了一种新颖的二维相对自注意力机制,其在作为图像分类的独立计算原语替代卷积时表现出竞争力。我们在控制实验中发现,将卷积与自注意力结合可获得最佳结果。因此我们提出通过该自注意力机制增强卷积算子,具体是将卷积特征图与一组由自注意力生成的特征图拼接。大量实验表明,注意力增强在 ImageNet 图像分类与 COCO 目标检测上,于许多不同模型与规模(包括 ResNets 与一种最先进的移动受限网络)均带来一致提升,同时保持参数量相近。特别地,我们的方法在 ImageNet 分类上相较 ResNet50 基线取得 的 top-1 准确率提升,并优于其他图像注意力机制如 Squeeze-and-Excitation。其在 RetinaNet 基线上亦于 COCO 目标检测取得 1.4 mAP 的提升。
引用
@article{arxiv.1904.09925,
title = {Attention Augmented Convolutional Networks},
author = {Irwan Bello and Barret Zoph and Ashish Vaswani and Jonathon Shlens and Quoc V. Le},
journal= {arXiv preprint arXiv:1904.09925},
year = {2020}
}
备注
ICCV 2019