CaFT:基于 Transformer 令牌聚类与滤波的弱监督目标定位
计算机视觉与模式识别
2022-01-04 v1
摘要
弱监督目标定位(WSOL)是一项仅利用类别标签来定位目标的具有挑战性的任务。然而,分类与定位之间存在矛盾,因为准确的分类网络倾向于关注物体的判别性区域而非整体。我们提出这种判别性是由基于 CAM 的方法中手工阈值的选择所引起的。因此,我们提出以 Vision Transformer (ViT) 为骨干的令牌聚类与滤波(CaFT)以另一种方式解决该问题。CaFT 首先将图像分割后的图像块令牌送入 ViT,并对输出令牌进行聚类以生成目标的初始掩码。其次,CaFT 将初始掩码视为伪标签来训练跟随骨干的浅层卷积头(注意力滤波器,AtF),以直接从令牌中提取掩码。然后,CaFT 将图像分成若干部分,分别输出掩码并合并为一个精炼掩码。最后,在精炼掩码上训练一个新的 AtF 并用于预测目标边界框。实验验证 CaFT 优于先前工作,在 CUB-200 和 ImageNet-1K 上分别利用真值类别取得了 97.55% 和 69.86% 的定位准确率。CaFT 为思考 WSOL 任务提供了新思路。
引用
@article{arxiv.2201.00475,
title = {CaFT: Clustering and Filter on Tokens of Transformer for Weakly Supervised Object Localization},
author = {Ming Li},
journal= {arXiv preprint arXiv:2201.00475},
year = {2022}
}