DiPS:基于自监督 Transformer 的判别性伪标签采样用于弱监督目标定位
计算机视觉与模式识别
2023-10-20 v2
摘要
自监督视觉 Transformer(SST)已展现出巨大潜力,能够生成丰富的定位图,突出图像中的不同物体。然而,由于模型是无监督的,这些图仍然是类别无关的。它们往往倾向于将图像分解为包含不同物体的多个图,却无法将感兴趣物体与背景噪声物体区分开来。本文提出判别性伪标签采样(DiPS),利用这些类别无关的图进行弱监督目标定位(WSOL),其中仅提供图像类别标签。给定多个注意力图,DiPS 依赖一个预训练分类器来识别每个注意力图中最具判别性的区域。这确保了所选 ROI 覆盖正确的图像物体而丢弃背景物体,并由此提供一个丰富且多样、具判别性的候选区域池以覆盖物体的不同部分。随后,这些候选区域被用作伪标签来训练我们新设计的、基于 Transformer 的 WSOL 模型,该模型旨在执行分类与定位任务。与标准 WSOL 方法不同,DiPS 通过使用一个 Transformer 编码器和每个任务专用的输出头(各自使用专用损失函数训练)来优化两项任务的性能。为避免对单一候选区域过拟合并促进更好的物体覆盖,在每步训练中为一张训练图像从排名靠前的候选中随机选一个。在具有挑战性的 CUB、ILSVRC、OpenImages 和 TelDrone 数据集上的实验结果表明,我们的架构结合基于 Transformer 的候选区域,能比最先进的方法取得更好的定位性能。
引用
@article{arxiv.2310.06196,
title = {DiPS: Discriminative Pseudo-Label Sampling with Self-Supervised Transformers for Weakly Supervised Object Localization},
author = {Shakeeb Murtaza and Soufiane Belharbi and Marco Pedersoli and Aydin Sarraf and Eric Granger},
journal= {arXiv preprint arXiv:2310.06196},
year = {2023}
}