关注激活:一种用于细粒度图像识别的模块化注意力机制
计算机视觉与模式识别
2019-07-31 v1 机器学习
图像与视频处理
摘要
细粒度图像识别是搜索、检索和字幕等许多多媒体任务的核心。不幸的是,这些任务仍然具有挑战性,因为同一类样本的外观可能比不同类样本之间的差异更大。在神经网络中,注意力通常通过选择图像中最具信息量的区域来提升分类性能。相比之下,在本文中,注意力不是在图像层面应用,而是应用于卷积特征激活。本质上,通过我们的方法,神经模型学会关注低层特征激活,而无需部分标注,并使用这些激活来更新和修正输出似然分布。所提出的机制是模块化的、与架构无关的,并且在所需参数和计算量方面都很高效。实验表明,众所周知的网络,如 Wide Residual Networks 和 ResNeXt,在通过我们的方法增强后,系统地提高了它们的分类精度,并且对形变、姿态变化以及杂乱背景的存在变得更加鲁棒。因此,我们的方案在 CIFAR-10、Adience 性别识别任务、Stanford Dogs 和 UEC-Food100 上达到了最先进的分类精度,同时在 ImageNet、CIFAR-100、CUB200 Birds 和 Stanford Cars 上获得了有竞争力的性能。此外,我们分析了模型的不同组件,表明所提出的注意力模块成功地找到了图像中最具判别力的区域。最后,作为概念验证,我们证明仅通过局部预测,增强后的神经网络就可以在到达任何全连接层之前成功地对图像进行分类,从而将计算量减少高达 10%。
引用
@article{arxiv.1907.13075,
title = {Pay attention to the activations: a modular attention mechanism for fine-grained image recognition},
author = {Pau Rodríguez López and Diego Velazquez Dorta and Guillem Cucurull Preixens and Josep M. Gonfaus and F. Xavier Roca Marva and Jordi Gonzàlez Sabaté},
journal= {arXiv preprint arXiv:1907.13075},
year = {2019}
}
备注
IEEE Transactions on Multimedia, ECCV extension