利用视觉与语言模型及无标注数据用于目标检测
计算机视觉与模式识别
2022-07-20 v1
摘要
构建鲁棒且通用的目标检测框架需要扩展到更大的标签空间和更大的训练数据集。然而,大规模获取数千个类别的标注成本高昂。我们提出了一种新方法,利用近期视觉与语言模型中丰富的语义来定位并分类无标注图像中的物体,有效生成用于目标检测的伪标签。从通用且类别不可知的区域提议机制出发,我们使用视觉与语言模型将图像每个区域分类为下游任务所需的任意物体类别。我们在两个具体任务中展示了所生成伪标签的价值:开放词汇检测(模型需泛化到未见物体类别)和半监督目标检测(可利用额外无标注图像改进模型)。我们的实证评估显示了伪标签在两项任务中的有效性,优于具有竞争力的基线,并实现了开放词汇目标检测的新最先进水平。我们的代码可在 https://github.com/xiaofeng94/VL-PLM 获取。
引用
@article{arxiv.2207.08954,
title = {Exploiting Unlabeled Data with Vision and Language Models for Object Detection},
author = {Shiyu Zhao and Zhixing Zhang and Samuel Schulter and Long Zhao and Vijay Kumar B. G and Anastasis Stathopoulos and Manmohan Chandraker and Dimitris Metaxas},
journal= {arXiv preprint arXiv:2207.08954},
year = {2022}
}
备注
Accepted to ECCV 2022 (with the supplementary document)