中文

用于弱监督目标定位的语义约束匹配Transformer

计算机视觉与模式识别 2023-09-06 v1

摘要

弱监督目标定位(WSOL)致力于仅利用图像级监督学习定位目标。由于卷积操作生成的局部感受野,此前的基于CNN的方法存在局部激活问题,集中于目标的可判别部分而非整个实体范围。得益于自注意力机制获取长程特征依赖的能力,Vision Transformer近期被应用于缓解局部激活缺陷。然而,由于transformer缺乏CNN固有的归纳定位偏置,可能导致发散激活问题,造成前景与背景的不确定区分。本工作中,我们通过transformer提出了一种新颖的语义约束匹配网络(SCMN)以收敛发散激活。具体而言,我们首先提出局部块打乱策略来构建图像对,在打乱局部块的同时保证全局一致性。包含空间共现目标的成对图像随后被送入孪生网络编码器。我们进一步设计语义约束匹配模块,旨在通过匹配从成对图像提取的粗粒度类激活图(CAMs)来挖掘共目标部分,从而隐式引导并校准transformer网络以缓解发散激活。在CUB-200-2011与ILSVRC两个具挑战性基准上的大量实验结果表明,我们的方法可达到新的最先进性能,并大幅超越此前方法。

关键词

引用

@article{arxiv.2309.01331,
  title  = {Semantic-Constraint Matching Transformer for Weakly Supervised Object Localization},
  author = {Yiwen Cao and Yukun Su and Wenjun Wang and Yanxia Liu and Qingyao Wu},
  journal= {arXiv preprint arXiv:2309.01331},
  year   = {2023}
}