自监督 Transformer 中用于弱监督目标定位的判别性候选区域采样
计算机视觉与模式识别
2022-11-22 v2
摘要
无人机正被应用于日益增长的视觉识别场景中。基站巡检近期的发展之一是基于无人机的资产监视,其通过在前后续航拍图像中定位感兴趣目标来引导无人机自主飞行。本文提出一种仅基于图像类别标签训练深度弱监督目标定位(WSOL)模型以高置信度定位目标的方法。为训练定位器,伪标签从自监督视觉 Transformer(SST)中高效获取。然而,由于 SST 将场景分解为包含各类物体部件的多个映射,且不依赖任何显式监督信号,其无法如 WSOL 所需那样区分感兴趣目标与其他物体。为解决此问题,我们提出利用不同 Transformer 头生成的多个映射来获取伪标签以训练深度 WSOL 模型。具体而言,引入一种新颖的判别性候选区域采样(DiPS)方法,其依托 CNN 分类器识别判别性区域。随后从这些区域中采样前景与背景像素,以训练 WSOL 模型生成能准确定位特定类别物体的激活图。在具挑战性的 TelDrone 数据集上的实证结果表明,所提方法在生成映射的广泛阈值范围内均优于当前最优方法。我们亦在 CUB 数据集上计算结果,显示本方法可适配其他任务。
引用
@article{arxiv.2209.09209,
title = {Discriminative Sampling of Proposals in Self-Supervised Transformers for Weakly Supervised Object Localization},
author = {Shakeeb Murtaza and Soufiane Belharbi and Marco Pedersoli and Aydin Sarraf and Eric Granger},
journal= {arXiv preprint arXiv:2209.09209},
year = {2022}
}