中文

TS-CAM:用于弱监督目标定位的令牌语义耦合注意力图

计算机视觉与模式识别 2021-08-05 v5

摘要

弱监督目标定位(WSOL)在仅给定图像类别标签却需要学习目标定位模型时是一个具有挑战性的问题。为分类而优化卷积神经网络(CNN)往往激活局部判别区域而忽略完整目标范围,导致局部激活问题。本文认为,局部激活是由 CNN 的固有特性引起的,其中卷积操作产生局部感受野且难以捕捉像素间的长程特征依赖。我们引入令牌语义耦合注意力图(TS-CAM)以充分利用视觉 transformer 中的自注意力机制进行长程依赖提取。TS-CAM 首先将图像分割为一系列 patch 令牌以进行空间嵌入,从而产生长程视觉依赖的注意力图以避免局部激活。TS-CAM 随后为 patch 令牌重新分配类别相关语义,使每个令牌都能感知目标类别。TS-CAM 最后将 patch 令牌与语义无关的注意力图相耦合,以实现语义感知的定位。在 ILSVRC/CUB-200-2011 数据集上的实验表明,TS-CAM 在 WSOL 上以 7.1%/27.1% 优于其 CNN-CAM 对应方法,取得了最先进的性能。

关键词

引用

@article{arxiv.2103.14862,
  title  = {TS-CAM: Token Semantic Coupled Attention Map for Weakly Supervised Object Localization},
  author = {Wei Gao and Fang Wan and Xingjia Pan and Zhiliang Peng and Qi Tian and Zhenjun Han and Bolei Zhou and Qixiang Ye},
  journal= {arXiv preprint arXiv:2103.14862},
  year   = {2021}
}

备注

Accepted by ICCV2021 (poster)