中文

学习注意力成对交互以实现细粒度分类

计算机视觉与模式识别 2020-02-25 v1

摘要

细粒度分类是一个具有挑战性的问题,原因在于高度混淆的类别之间差异细微。大多数方法通过学习单个输入图像的判别性表示来解决这一困难。另一方面,人类可以通过比较图像对有效地识别对比线索。受此启发,本文提出一种简单而有效的注意力成对交互网络(API-Net),它可以通过交互逐步识别一对细粒度图像。具体而言,API-Net首先学习一个互特征向量以捕获输入对中的语义差异。然后将该互向量与各个向量进行比较,为每张输入图像生成门控。这些不同的门控向量继承了关于语义差异的互上下文,使API-Net能够通过两幅图像间的成对交互注意力地捕获对比线索。此外,我们以端到端方式结合分数排序正则化训练API-Net,这能通过考虑特征优先级进一步泛化API-Net。我们在细粒度分类的五个流行基准上进行了大量实验。API-Net优于近期SOTA方法,即在CUB-200-2011(90.0%)、Aircraft(93.9%)、Stanford Cars(95.3%)、Stanford Dogs(90.3%)和NABirds(88.1%)上。

关键词

引用

@article{arxiv.2002.10191,
  title  = {Learning Attentive Pairwise Interaction for Fine-Grained Classification},
  author = {Peiqin Zhuang and Yali Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2002.10191},
  year   = {2020}
}

备注

Accepted at AAAI-2020