中文

ViT-FOD:一种基于视觉Transformer的细粒度物体判别器

计算机视觉与模式识别 2022-03-25 v1

摘要

近来,若干基于视觉Transformer(ViT)的方法被提出用于细粒度视觉分类(FGVC)。这些方法显著超越现有基于CNN的方法,证明了ViT在FGVC任务中的有效性。然而,直接将ViT应用于FGVC存在局限。首先,ViT需将图像分块并计算每对块注意力,在处理背景复杂、物体小的细粒度图像时可能导致大量冗余计算且性能不佳。其次,标准ViT仅利用最终层的类令牌分类,不足以提取全面的细粒度信息。为解决这些问题,我们提出一种用于FGVC任务的新型基于ViT的细粒度物体判别器,简称ViT-FOD。具体地,除ViT骨干外,它进一步引入三个新组件,即注意力块组合(APC)、关键区域滤波(CRF)和互补令牌整合(CTI)。其中,APC从两幅图像中拼接信息块生成新图像以减少冗余计算。CRF强调对应判别区域的令牌以生成新类令牌用于细微特征学习。为提取全面信息,CTI整合不同ViT层类令牌捕获的互补信息。我们在广泛使用的数据集上进行了全面实验,结果表明ViT-FOD能够达到SOTA性能。

关键词

引用

@article{arxiv.2203.12816,
  title  = {ViT-FOD: A Vision Transformer based Fine-grained Object Discriminator},
  author = {Zi-Chao Zhang and Zhen-Duo Chen and Yongxin Wang and Xin Luo and Xin-Shun Xu},
  journal= {arXiv preprint arXiv:2203.12816},
  year   = {2022}
}