DetCLIP:面向开放世界检测的字典增强视觉概念并行预训练
计算机视觉与模式识别
2022-10-18 v2
摘要
开放世界目标检测作为一个更通用且更具挑战性的目标,旨在识别并定位由任意类别名称描述的对象。近期工作GLIP将这一问题表述为定位问题,把检测数据集的所有类别名称拼接成句子,这导致类别名称之间的交互效率低下。本文提出DetCLIP,一种借助所设计概念字典的知识增强来实现开放世界检测并行视觉概念预训练的方法。为获得更好的学习效率,我们提出一种新颖的并行概念表述,分别提取概念以更好地利用异构数据集(即检测、定位和图像-文本对)进行训练。我们进一步从各类在线资源和检测数据集设计了一个带描述的概念字典,为每个概念提供先验知识。通过用描述丰富概念,我们显式地构建了各概念之间的关系以促进开放域学习。所提出的概念字典还被用于为词-区域对齐损失的构建提供充分的负概念,并补全图像-文本对数据标题中缺失描述的对象标签。所提框架展现出强大的零样本检测性能,例如在LVIS数据集上,我们的DetCLIP-T比GLIP-T高出9.9% mAP,并与具有相同骨干网络的 Fully-supervised 模型相比在稀有类别上获得13.5%的提升。
引用
@article{arxiv.2209.09407,
title = {DetCLIP: Dictionary-Enriched Visual-Concept Paralleled Pre-training for Open-world Detection},
author = {Lewei Yao and Jianhua Han and Youpeng Wen and Xiaodan Liang and Dan Xu and Wei Zhang and Zhenguo Li and Chunjing Xu and Hang Xu},
journal= {arXiv preprint arXiv:2209.09407},
year = {2022}
}
备注
Accepted to NeurIPS 2022