用于图像分类的残差注意力网络
计算机视觉与模式识别
2017-04-25 v1
摘要
在本工作中,我们提出“残差注意力网络”,一种采用注意力机制的卷积神经网络,其能够以端到端训练的方式与最先进的前馈网络架构相结合。我们的残差注意力网络通过堆叠生成注意力感知特征的注意力模块构建而成。来自不同模块的注意力感知特征随着网络层加深而自适应变化。在每个注意力模块内部,采用自底向上自顶向下的前馈结构,将前馈与反馈注意力过程展开为单一的前馈过程。重要的是,我们提出注意力残差学习来训练非常深的残差注意力网络,该网络可轻松扩展至数百层。我们在CIFAR-10和CIFAR-100数据集上进行了大量分析,以验证上述每个模块的有效性。我们的残差注意力网络在三个基准数据集上实现了最先进的物体识别性能,包括CIFAR-10(错误率3.90%)、CIFAR-100(错误率20.45%)和ImageNet(单模型单裁剪top-5错误率4.8%)。值得注意的是,与ResNet-200相比,我们的方法以46%的主干深度和69%的前向FLOPs实现了0.6%的top-1准确率提升。实验还表明我们的网络对噪声标签具有鲁棒性。
引用
@article{arxiv.1704.06904,
title = {Residual Attention Network for Image Classification},
author = {Fei Wang and Mengqing Jiang and Chen Qian and Shuo Yang and Cheng Li and Honggang Zhang and Xiaogang Wang and Xiaoou Tang},
journal= {arXiv preprint arXiv:1704.06904},
year = {2017}
}
备注
accepted to CVPR2017