用于细粒度视觉分类的Grad-CAM引导通道-空间注意力模块
计算机视觉与模式识别
2021-01-26 v1
摘要
细粒度视觉分类(FGVC)因广泛应用和计算机视觉技术的快速发展而成为重要研究领域。当前FGVC中的最优(SOTA)方法通常采用注意力机制先捕获语义部位,再发现不同类别间的细微差异。通道-空间注意力机制同时关注判别性通道与区域,显著提升了分类性能。然而,现有注意力模块引导较差,因为FGVC中基于部位的检测器依赖网络学习能力而缺乏部位标注监督。由于获取此类部位标注费时费力,一些视觉定位与解释方法(如梯度加权类激活映射(Grad-CAM))可用于监督注意力机制。我们提出一种用于FGVC的Grad-CAM引导通道-空间注意力模块,利用Grad-CAM生成粗定位图以监督和约束注意力权重。为证明所提方法的有效性,我们在三个流行FGVC数据集(包括CUB--、Stanford Cars和FGVC-Aircraft数据集)上进行了全面实验。所提方法在FGVC任务上优于SOTA注意力模块。此外,特征图可视化也展示了所提方法相对于SOTA方法的优越性。
引用
@article{arxiv.2101.09666,
title = {Grad-CAM guided channel-spatial attention module for fine-grained visual classification},
author = {Shuai Xu and Dongliang Chang and Jiyang Xie and Zhanyu Ma},
journal= {arXiv preprint arXiv:2101.09666},
year = {2021}
}