CapDet:统一密集描述与开放世界检测预训练
计算机视觉与模式识别
2023-03-16 v3
摘要
受益于基于图文对的大规模视觉-语言预训练,开放世界检测方法在零样本或少样本检测设定下展现出优越的泛化能力。然而,现有方法在推理阶段仍需要预定义的类别空间,且仅有属于该空间的物体会被预测。为引入一个“真正”的开放世界检测器,本文提出一种名为CapDet的新方法,其既可在给定类别列表下预测,也可直接生成预测边界框的类别。具体而言,我们通过引入一个额外的密集描述头以生成区域接地描述,将开放世界检测与密集描述任务统一到一个单一而有效的框架中。此外,由于描述数据集涵盖更多概念,添加描述任务将反过来有益于检测性能的泛化。实验结果表明,通过统一密集描述任务,我们的CapDet在LVIS(1203类)上相比基线方法获得了显著的性能提升(例如,在LVIS稀有类上mAP提升+2.1%)。此外,我们的CapDet在密集描述任务上也达到了最先进的性能,例如在VG V1.2上mAP为15.44%,在VG-COCO数据集上为13.98%。
引用
@article{arxiv.2303.02489,
title = {CapDet: Unifying Dense Captioning and Open-World Detection Pretraining},
author = {Yanxin Long and Youpeng Wen and Jianhua Han and Hang Xu and Pengzhen Ren and Wei Zhang and Shen Zhao and Xiaodan Liang},
journal= {arXiv preprint arXiv:2303.02489},
year = {2023}
}
备注
Accepted by CVPR2023