中文

一种用于细粒度视觉分类的新型插件模块

计算机视觉与模式识别 2022-02-09 v1 人工智能

摘要

视觉分类可分为粗粒度和细粒度分类。粗粒度分类表示差异较大的类别,如猫和狗的分类;而细粒度分类表示相似度很高的分类,如猫种、鸟种以及车辆的品牌或型号。与粗粒度视觉分类不同,细粒度视觉分类常需专业专家标注数据,使数据成本更高。为应对此挑战,许多方法提出自动寻找最具判别性的区域并利用局部特征提供更精确的特征。这些方法仅需图像级标注,从而降低了标注成本。然而,此类方法大多需要两阶段或多阶段架构,无法端到端训练。因此,我们提出一种可集成到许多常见骨干网络(包括基于 CNN 或 Transformer 的网络)中的新型插件模块,以提供强判别性区域。该插件模块可输出像素级特征图并融合过滤后的特征以增强细粒度视觉分类。实验结果表明,所提插件模块优于当前最优方法,在 CUB200-2011 和 NABirds 上分别将准确率显著提升至 92.77% 和 92.83%。我们已在 Github https://github.com/chou141253/FGVC-PIM.git 发布源代码。

关键词

引用

@article{arxiv.2202.03822,
  title  = {A Novel Plug-in Module for Fine-Grained Visual Classification},
  author = {Po-Yung Chou and Cheng-Hung Lin and Wen-Chung Kao},
  journal= {arXiv preprint arXiv:2202.03822},
  year   = {2022}
}