中文

R2-Trans:基于冗余缩减的细粒度视觉分类

计算机视觉与模式识别 2022-04-22 v1 人工智能

摘要

细粒度视觉分类(FGVC)旨在区分相似的子类别,其主要挑战是类内多样性大且类间差异细微。现有 FGVC 方法通常选择由训练好的模型发现的判别区域,这容易忽略其他潜在的判别信息。另一方面,ViT 中图像块序列之间的大量交互使得生成的类令牌包含大量冗余信息,这也可能影响 FGVC 性能。本文提出一种新颖的 FGVC 方法,可同时利用环境线索中局部但充分的判别信息,并压缩类令牌中相对于目标的冗余信息。具体而言,我们的模型计算一个批次中高权重区域的比例,自适应调整掩码阈值,并在输入空间中对背景信息实现适度提取。此外,我们还使用信息瓶颈(IB)方法引导网络在特征空间中学习最小充分表示。在三个广泛使用的基准数据集上的实验结果验证了我们的方法可比其他最先进方法与基线模型取得更优性能。

关键词

引用

@article{arxiv.2204.10095,
  title  = {R2-Trans:Fine-Grained Visual Categorization with Redundancy Reduction},
  author = {Yu Wang and Shuo Ye and Shujian Yu and Xinge You},
  journal= {arXiv preprint arXiv:2204.10095},
  year   = {2022}
}