中文

RAMS-Trans:用于细粒度图像识别的循环注意力多尺度 Transformer

计算机视觉与模式识别 2021-07-20 v1

摘要

在细粒度图像识别(FGIR)中,区域注意力的定位与放大是一个重要因素,基于卷积神经网络(CNNs)的方法已对此进行了大量探索。近年来发展的视觉 Transformer(ViT)在计算机视觉任务上取得了有前景的结果。与 CNNs 相比,图像序列化是一种全新的方式。然而,ViT 由于其补丁的固定尺寸,其感受野大小受限,因而缺乏像 CNNs 那样的局部注意力,并且无法生成多尺度特征来学习有判别性的区域注意力。为了在没有框/部件标注的情况下促进有判别性的区域注意力的学习,我们利用注意力权重的强度来衡量对应于原始图像的补丁令牌的重要性。我们提出了循环注意力多尺度 Transformer(RAMS-Trans),它利用 Transformer 的自注意力以多尺度方式递归地学习有判别性的区域注意力。具体而言,我们方法的核心在于由动态补丁提议模块(DPPM)引导的区域放大,以完成多尺度图像补丁的整合。DPPM 从全尺寸图像补丁开始,并根据每一尺度生成的注意力权重的强度作为指示,迭代地放大区域注意力以从全局到局部生成新补丁。我们的方法仅需要 ViT 本身附带的注意力权重,并且可以轻松端到端训练。大量实验表明,RAMS-Trans 优于同期工作以及高效的 CNN 模型,在三个基准数据集上取得了最先进的结果。

关键词

引用

@article{arxiv.2107.08192,
  title  = {RAMS-Trans: Recurrent Attention Multi-scale Transformer forFine-grained Image Recognition},
  author = {Yunqing Hu and Xuan Jin and Yin Zhang and Haiwen Hong and Jingfeng Zhang and Yuan He and Hui Xue},
  journal= {arXiv preprint arXiv:2107.08192},
  year   = {2021}
}