PromptDet:使用未筛选图像实现开放词汇检测
计算机视觉与模式识别
2022-07-19 v2
摘要
本工作的目标是建立一条可扩展的流水线,利用零人工标注将目标检测器扩展到新颖/未见类别。为此,我们做出以下四点贡献:(i) 为追求泛化性,我们提出一种两阶段开放词汇目标检测器,其中类无关的目标提议由预训练视觉-语言模型的文本编码器分类;(ii) 为使视觉潜在空间(来自 RPN 框提议)与预训练文本编码器的空间配对,我们提出区域提示学习的思想,以将文本嵌入空间与区域视觉目标特征对齐;(iii) 为扩展学习过程以检测更广谱的目标,我们通过一种新颖的自训练框架利用可用的在线资源,该框架允许在大量含噪声的未筛选网络图像上训练所提出的检测器。最后,(iv) 为评估我们提出的称为 PromptDet 的检测器,我们在具有挑战性的 LVIS 和 MS-COCO 数据集上进行了大量实验。PromptDet 以更少的额外训练图像和零人工标注展现了优于现有方法的性能。项目页面与代码:https://fcjian.github.io/promptdet。
引用
@article{arxiv.2203.16513,
title = {PromptDet: Towards Open-vocabulary Detection using Uncurated Images},
author = {Chengjian Feng and Yujie Zhong and Zequn Jie and Xiangxiang Chu and Haibing Ren and Xiaolin Wei and Weidi Xie and Lin Ma},
journal= {arXiv preprint arXiv:2203.16513},
year = {2022}
}
备注
ECCV2022