中文

基于归一化割的自监督Transformer无监督目标发现

计算机视觉与模式识别 2022-03-25 v2 机器学习

摘要

使用自蒸馏损失(DINO)进行自监督学习训练的Transformer已被证明能产生突出显著前景目标的注意力图。本文中,我们展示一种基于图的方法,利用自监督Transformer特征从图像中发现目标。视觉令牌被视为加权图中的节点,边表示基于令牌相似度的连通性分数。随后可使用归一化图割对自相似区域分组来分割前景目标。我们通过广义特征分解的谱聚类求解图割问题,并表明第二小特征向量提供割解,因为其绝对值指示令牌属于前景目标的可能性。尽管简单,该方法显著提升了无监督目标发现的性能:我们在VOC07、VOC12和COCO20K上分别比近期最优的LOST高出6.9%、8.1%和8.1%。通过添加第二阶段类无关检测器(CAD)可进一步提升性能。我们提出的方法可轻松扩展至无监督显著性检测与弱监督目标检测。对于无监督显著性检测,相比先前最优方法,我们在ECSSD、DUTS、DUT-OMRON上分别提升IoU 4.9%、5.2%、12.9%。对于弱监督目标检测,我们在CUB和ImageNet上取得有竞争力的性能。

关键词

引用

@article{arxiv.2202.11539,
  title  = {Self-Supervised Transformers for Unsupervised Object Discovery using Normalized Cut},
  author = {Yangtao Wang and Xi Shen and Shell Hu and Yuan Yuan and James Crowley and Dominique Vaufreydaz},
  journal= {arXiv preprint arXiv:2202.11539},
  year   = {2022}
}