ProposalCLIP:利用 CLIP 线索的无监督开放类别物体候选框生成方法
计算机视觉与模式识别
2022-01-19 v1
摘要
物体候选框生成是计算机视觉中一项重要且基础的任务。本文提出 ProposalCLIP,一种面向无监督开放类别物体候选框生成的方法。与以往需要大量边界框标注和/或只能为有限物体类别生成候选框的工作不同,我们的 ProposalCLIP 能够通过利用 CLIP(对比语言-图像预训练)线索,在无标注情况下预测大量物体类别的候选框。首先,我们针对无监督开放类别候选框生成对 CLIP 进行分析,并基于候选框选择的实证分析设计了一个目标性分数。其次,提出一种基于图的合并模块,以解决 CLIP 线索的局限性并合并碎片化的候选框。最后,我们提出一个候选框回归模块,该模块基于 CLIP 线索提取伪标签并训练一个轻量网络以进一步精炼候选框。在 PASCAL VOC、COCO 和 Visual Genome 数据集上的大量实验表明,我们的 ProposalCLIP 比以往最先进的方法能更好地生成候选框。我们的 ProposalCLIP 还展示出对下游任务(如无人监督物体检测)的益处。
引用
@article{arxiv.2201.06696,
title = {ProposalCLIP: Unsupervised Open-Category Object Proposal Generation via Exploiting CLIP Cues},
author = {Hengcan Shi and Munawar Hayat and Yicheng Wu and Jianfei Cai},
journal= {arXiv preprint arXiv:2201.06696},
year = {2022}
}
备注
10 pages, 5 figures