用于细粒度视觉分类的多分支多尺度注意力学习
计算机视觉与模式识别
2020-07-22 v3 机器学习
图像与视频处理
摘要
ImageNet大规模视觉识别挑战赛(ILSVRC)是近年来计算机视觉(CV)领域最具权威性的学术竞赛之一。但将ILSVRC的年度冠军模型直接应用于细粒度视觉分类(FGVC)任务并不能取得良好性能。对于FGVC任务,类间差异小和类内差异大使其成为一个具有挑战性的问题。我们的注意力目标定位模块(AOLM)能够预测目标的位置,注意力部件提议模块(APPM)能够提议信息丰富的部件区域,且无需边界框或部件标注。所获得的目标图像不仅包含目标几乎完整的整体结构,还包含更多细节;部件图像具有多种不同尺度和更细粒度的特征;原始图像包含完整的目标。这三种训练图像由我们的多分支网络进行监督。因此,我们的多分支多尺度学习网络(MMAL-Net)对不同尺度图像具有良好的分类能力和鲁棒性。我们的方法可以端到端训练,同时具有较短的推理时间。综合实验表明,我们的方法在CUB-200-2011、FGVC-Aircraft和Stanford Cars数据集上取得了最先进(state-of-the-art)的结果。我们的代码将发布于https://github.com/ZF1044404254/MMAL-Net。
引用
@article{arxiv.2003.09150,
title = {Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization},
author = {Fan Zhang and Meng Li and Guisheng Zhai and Yizhao Liu},
journal= {arXiv preprint arXiv:2003.09150},
year = {2020}
}