中文

DetCLIPv2:基于词-区对齐的可扩展开放词汇目标检测预训练

计算机视觉与模式识别 2023-04-11 v1

摘要

本文提出DetCLIPv2,一个高效且可扩展的训练框架,其引入大规模图像-文本对以实现开放词汇目标检测(OVD)。不同于以往通常依赖预训练视觉-语言模型(如CLIP)或通过伪标注过程利用图像-文本对的OVD框架,DetCLIPv2以端到端方式直接从海量图像-文本对学习细粒度的词-区对齐。为此,我们采用区域提议与文本词之间的最大词-区相似度来引导对比目标。为使模型在学习广泛概念的同时获得定位能力,DetCLIPv2在统一数据形式下以检测、指称和图像-文本对数据的混合监督进行训练。通过交替训练方案并采用低分辨率输入处理图像-文本对,DetCLIPv2高效且有效地利用了图像-文本对数据:DetCLIPv2使用的图像-文本对比DetCLIP多13倍,且训练时间相近,并提升了性能。以13M图像-文本对预训练,DetCLIPv2展现出优越的开放词汇检测性能,例如采用Swin-T骨干的DetCLIPv2在LVIS基准上取得40.4%零样本AP,分别超越以往工作GLIP/GLIPv2/DetCLIP 14.4/11.4/4.5% AP,甚至大幅优于其全监督对应模型。

关键词

引用

@article{arxiv.2304.04514,
  title  = {DetCLIPv2: Scalable Open-Vocabulary Object Detection Pre-training via Word-Region Alignment},
  author = {Lewei Yao and Jianhua Han and Xiaodan Liang and Dan Xu and Wei Zhang and Zhenguo Li and Hang Xu},
  journal= {arXiv preprint arXiv:2304.04514},
  year   = {2023}
}

备注

Accepted to CVPR2023