MOST:基于自监督 Transformer 的多目标定位用于物体发现
计算机视觉与模式识别
2023-08-29 v2
摘要
本工作致力于解决无监督物体定位这一具有挑战性的任务。近来,经自监督学习训练的 Transformer 被证明可在未针对该任务训练的情况下展现出物体定位特性。在此我们提出 Multiple Object localization with Self-supervised Transformers (MOST),利用自监督学习训练的 Transformer 特征在真实世界图像中定位多个物体。MOST 通过盒计数(一种分形分析工具)分析特征的相似度图,以识别位于前景块上的 token。随后将识别出的 token 聚类,每个聚类的 token 用于在前景区域生成边界框。与近期最先进的物体定位方法不同,MOST 可每图定位多个物体,并在 PASCAL-VOC 07、12 及 COCO20k 数据集的多个物体定位与发现基准上优于 SOTA 算法。此外,我们展示了 MOST 可用于物体检测器的自监督预训练,并在全监督、半监督物体检测及无监督区域提议生成上取得一致提升。
引用
@article{arxiv.2304.05387,
title = {MOST: Multiple Object localization with Self-supervised Transformers for object discovery},
author = {Sai Saketh Rambhatla and Ishan Misra and Rama Chellappa and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2304.05387},
year = {2023}
}
备注
Accepted to ICCV2023 as an Oral. Project webpage: https://rssaketh.github.io/most