面向细粒度图像识别的多注意力多类别约束
计算机视觉与模式识别
2018-06-15 v1
摘要
基于注意力的细粒度图像识别学习仍具挑战性,现有方法多孤立处理各物体部件,而忽略它们之间的关联。此外,所涉及的多阶段或多尺度机制使现有方法效率较低且难以端到端训练。本文提出一种新颖的基于注意力的卷积神经网络(CNN),其在不同输入图像间约束多个物体部件。我们的方法首先通过一压缩多激励(OSME)模块学习每幅输入图像的多个注意力区域特征,随后在度量学习框架中施加多注意力多类别约束(MAMC)。对于每个锚点特征,MAMC通过拉近同注意力同类别特征、推远不同注意力或不同类别特征来起作用。我们的方法可轻松端到端训练,且仅需一个训练阶段,因而高效。此外,我们引入Dogs-in-the-Wild,一个综合的犬种数据集,其在类别覆盖、数据量与标注质量上超越现有同类数据集。该数据集将在录用后发布,以促进细粒度图像识别研究。我们在四个基准数据集上进行了充分实验,展示了本方法的显著改进。
引用
@article{arxiv.1806.05372,
title = {Multi-Attention Multi-Class Constraint for Fine-grained Image Recognition},
author = {Ming Sun and Yuchen Yuan and Feng Zhou and Errui Ding},
journal= {arXiv preprint arXiv:1806.05372},
year = {2018}
}