聚焦更久以看得更清:用于细粒度图像分类的递归精炼注意力
计算机视觉与模式识别
2020-05-25 v1
摘要
深度神经网络在粗粒度图像分类任务中取得了巨大进展,部分原因在于其从图像中提取判别性特征表示的强大能力。然而,细粒度图像中不同类别之间微小的视觉差异使得该任务更为困难。本文中,我们试图聚焦于这些微小差异以提取更具代表性的特征。类似于人类视觉,我们的网络重复聚焦于图像的部分区域,以在不同类别间发现微小的判别性部位。此外,我们通过可解释性技术展示了我们网络的关注如何从粗粒度细节过渡到细粒度细节。通过实验,我们还表明一个简单的注意力模型可以聚合(加权)这些更精细的细节,从而聚焦于图像中最显著的判别性部位。我们的网络仅使用图像级标签,不需要边界框/部位标注信息。进一步,我们网络的简洁性使其成为一个易于即插即用的模块。除了提供可解释性外,与基线对应方法相比,我们的网络将性能提升了(高达 2%)。我们的代码库可在 https://github.com/TAMU-VITA/Focus-Longer-to-See-Better 获取。
引用
@article{arxiv.2005.10979,
title = {Focus Longer to See Better:Recursively Refined Attention for Fine-Grained Image Classification},
author = {Prateek Shroff and Tianlong Chen and Yunchao Wei and Zhangyang Wang},
journal= {arXiv preprint arXiv:2005.10979},
year = {2020}
}