中文

来自 ViT 的免费午餐:用于细粒度视觉识别的自适应注意力多尺度融合 Transformer

计算机视觉与模式识别 2021-10-12 v2 多媒体

摘要

学习物体部件上的细微表征在细粒度视觉识别(FGVR)领域中起着至关重要的作用。视觉 Transformer(ViT)凭借其注意力机制在计算机视觉上取得了令人瞩目的结果。然而,由于 ViT 中块尺寸固定,深层中的类令牌聚焦于全局感受野,无法为 FGVR 生成多粒度特征。为在无边界框标注下捕获区域注意力并弥补 ViT 在 FGVR 中的不足,我们提出一种名为自适应注意力多尺度融合 Transformer(AFTrans)的新方法。我们方法中的选择性注意力收集模块(SACM)利用 ViT 中的注意力权重,并自适应地过滤以匹配输入块的相对重要性。多尺度(全局与局部)流水线由我们的权重共享编码器监督,并可轻松端到端训练。综合实验表明,AFTrans 在三个已发布的细粒度基准 CUB-200-2011、Stanford Dogs 和 iNat2017 上取得了 SOTA 性能。

关键词

引用

@article{arxiv.2110.01240,
  title  = {A free lunch from ViT:Adaptive Attention Multi-scale Fusion Transformer for Fine-grained Visual Recognition},
  author = {Yuan Zhang and Jian Cao and Ling Zhang and Xiangcheng Liu and Zhiyi Wang and Feng Ling and Weiqian Chen},
  journal= {arXiv preprint arXiv:2110.01240},
  year   = {2021}
}