PEEKABOO:隐藏图像部分以实现无监督目标定位
计算机视觉与模式识别
2024-07-26 v1
摘要
在无监督方式下对目标进行定位面临着显著挑战,主要由于缺乏关键视觉信息(如目标的外观、类型和数量),以及缺乏监督设置中通常可用的标记目标类别。虽然近期的无监督目标定位方法通过利用自监督视觉表征取得了显著进展,但它们往往需要计算密集的训练过程,导致在计算、可学习参数和数据方面的高资源需求。此外,这些方法缺乏对视觉上下文的显式建模,可能限制了目标定位的准确性。为解决这些挑战,我们提出一种称为 PEEKABOO 的单阶段学习框架,通过图像遮蔽在目标局部的像素级和形状级上学习基于上下文的表征来实现无监督目标定位。核心思想是选择性地隐藏图像的部分内容,并利用剩余图像信息在没有显式监督的情况下推断目标的位置。实验结果在各种基准数据集上(定性和定量),均表明该方法的简单性、有效性和在单目标发现和无监督显著目标检测任务中与最先进方法的竞争性能。代码和预训练模型可在 https://github.com/hasibzunair/peekaboo 获取。
引用
@article{arxiv.2407.17628,
title = {PEEKABOO: Hiding parts of an image for unsupervised object localization},
author = {Hasib Zunair and A. Ben Hamza},
journal= {arXiv preprint arXiv:2407.17628},
year = {2024}
}