中文

上下文语义质量感知网络用于细粒度视觉分类

计算机视觉与模式识别 2024-03-18 v1

摘要

探索和挖掘外观相似的子类别之间细微而独特的特征对于细粒度视觉分类(FGVC)至关重要。然而,在评估提取的视觉表示质量方面所做的努力较少。直观上,网络可能难以从低质量样本中捕捉判别性特征,这会导致FGVC性能显著下降。为了应对这一挑战,我们提出了一种用于FGVC的弱监督上下文语义质量感知网络(CSQA-Net)。在该网络中,为了建模丰富的局部描述符与全局语义之间的空间上下文关系,以捕捉对象内更具判别性的细节,我们设计了一个新颖的多部分多尺度交叉注意力(MPMSCA)模块。在输入MPMSCA模块之前,开发了局部导航器以解决尺度混淆问题并准确识别局部显著区域。此外,我们提出了一个通用的多级语义质量评估模块(MLSQE),以逐步监督和增强来自骨干网络不同层级的层次语义。最后,来自MPMSCA的上下文感知特征和来自MLSQE的语义增强特征被输入到相应的质量探测分类器中,以实时评估其质量,从而提升特征表示的判别能力。在四个流行且极具竞争力的FGCV数据集上进行的全面实验表明,与最先进的方法相比,所提出的CSQA-Net具有优越性。

关键词

引用

@article{arxiv.2403.10298,
  title  = {Context-Semantic Quality Awareness Network for Fine-Grained Visual Categorization},
  author = {Qin Xu and Sitong Li and Jiahui Wang and Bo Jiang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2403.10298},
  year   = {2024}
}