中文

面向细粒度图像分类的扫视视觉

计算机视觉与模式识别 2025-09-22 v1 人工智能

摘要

细粒度图像分类(FGVC)要求通过细微的、局部的特征来区分视觉上相似的类别——由于较高的类内差异和有限的类间差异,这项任务仍然具有挑战性。现有的基于部件的方法通常依赖于复杂的定位网络,这些网络学习从像素空间到样本空间的映射,需要对图像内容有深入的理解,同时限制了下游任务中的特征效用。此外,采样点经常存在高空间冗余,使得难以量化所需部件的最佳数量。受人类扫视视觉启发,我们提出了一种两阶段过程,首先提取外围特征(粗略视图)并生成采样图,从中采样注视块,并使用权重共享编码器并行编码。我们采用上下文选择性注意力在融合外围和焦点表示之前权衡每个注视块的影响。为了防止空间坍缩——这是基于部件的方法中的一个常见问题——我们在注视采样期间利用非极大值抑制来消除冗余。在标准 FGVC 基准(CUB-200-2011、NABirds、Food-101 和 Stanford-Dogs)以及具有挑战性的昆虫数据集(EU-Moths、Ecuador-Moths 和 AMI-Moths)上的全面评估表明,我们的方法实现了与最先进方法相当的性能,同时始终优于我们的基线编码器。

关键词

引用

@article{arxiv.2509.15688,
  title  = {Saccadic Vision for Fine-Grained Visual Classification},
  author = {Johann Schmidt and Sebastian Stober and Joachim Denzler and Paul Bodesheim},
  journal= {arXiv preprint arXiv:2509.15688},
  year   = {2025}
}