面向细粒度视觉分类的语义特征整合网络
计算机视觉与模式识别
2023-02-22 v1
摘要
细粒度视觉分类 (FGVC) 因子类间差异细微而是一项公认具有挑战性的任务。许多现有 FGVC 方法侧重于利用注意力机制识别并定位判别性区域,却忽视了阻碍物体结构理解的不必要特征的存在。这些不必要的特征包括 1) 由物体外观视觉相似性导致的模糊部分,以及 2) 非信息性部分(如背景噪声),会对分类结果产生显著不利影响。本文中,我们提出语义特征整合网络 (SFI-Net) 以解决上述困难。通过消除不必要特征并重建判别性特征间的语义关系,我们的 SFI-Net 取得了令人满意的性能。该网络由两个模块组成:1) 提出多级特征滤波器 (MFF) 模块,以不同感受野去除不必要特征,随后在像素级拼接保留的特征以供后续处理;2) 提出语义信息重构 (SIR) 模块,以进一步建立从 MFF 模块获得的判别性特征间的语义关系。这两个模块经精心设计为轻量化,并可以弱监督方式端到端训练。在四个具有挑战性的细粒度基准上的大量实验表明,我们提出的 SFI-Net 达到了最先进的性能。特别地,我们的模型在 CUB-200-2011 和 Stanford Dogs 上的分类准确率分别达到 92.64% 和 93.03%。
引用
@article{arxiv.2302.10275,
title = {Semantic Feature Integration network for Fine-grained Visual Classification},
author = {Hui Wang and Yueyang li and Haichi Luo},
journal= {arXiv preprint arXiv:2302.10275},
year = {2023}
}