中文

ViTOL:用于弱监督目标定位的视觉Transformer

计算机视觉与模式识别 2022-04-15 v1

摘要

弱监督目标定位(WSOL)旨在仅利用图像级类别标签预测图像中目标的位置。图像分类模型在定位目标时面临的常见挑战包括:(a)它们倾向于关注图像中最具判别性的特征,使得定位图局限于极小的区域;(b)定位图是类别无关的,模型会在同一图像中高亮多个类别的目标;(c)定位性能受背景噪声影响。为缓解上述挑战,我们通过所提出的方法ViTOL引入了以下简单改进。我们利用基于视觉的Transformer进行自注意力,并引入基于块的注意力丢弃层(p-ADL)以增加定位图的覆盖区域,以及一种梯度注意力展开机制以生成类别相关的注意力图。我们在ImageNet-1K和CUB数据集上进行了广泛的定量、定性和消融实验。我们在两个数据集上分别取得了70.47%和73.17%的SOTA MaxBoxAcc-V2定位分数。代码已发布于 https://github.com/Saurav-31/ViTOL

关键词

引用

@article{arxiv.2204.06772,
  title  = {ViTOL: Vision Transformer for Weakly Supervised Object Localization},
  author = {Saurav Gupta and Sourav Lakhotia and Abhay Rawat and Rahul Tallamraju},
  journal= {arXiv preprint arXiv:2204.06772},
  year   = {2022}
}

备注

Accepted: 2022 IEEE CVPR Workshop on Learning with Limited Labelled Data for Image and Video Understanding (L3D-IVU)