DetCLIPv3:迈向多功能的生成式开放词汇目标检测
计算机视觉与模式识别
2024-04-16 v1
摘要
现有的开放词汇目标检测器通常需要用户预定义一组类别,这极大地限制了它们的应用场景。在本文中,我们介绍了DetCLIPv3,一个高性能的检测器,它不仅擅长开放词汇目标检测,还能为检测到的对象生成层次化标签。DetCLIPv3具有三个核心设计:1. 多功能模型架构:我们推导出一个鲁棒的开放集检测框架,并通过集成描述头进一步赋予其生成能力。2. 高信息密度数据:我们开发了一个自动标注流程,利用视觉大语言模型为大规模图像-文本对精炼描述,提供丰富的多粒度对象标签以增强训练。3. 高效训练策略:我们采用低分辨率输入的预训练阶段,使对象描述器能够从大量图像-文本配对数据中高效学习广泛的视觉概念。随后是微调阶段,利用少量高分辨率样本进一步提高检测性能。通过这些有效的设计,DetCLIPv3展示了卓越的开放词汇检测性能,例如,我们的Swin-T骨干模型在LVIS minival基准上实现了显著的47.0零样本固定AP,分别比GLIPv2、GroundingDINO和DetCLIPv2高出18.0/19.6/6.6 AP。DetCLIPv3还在VG数据集上的密集描述任务中实现了最先进的19.7 AP,展示了其强大的生成能力。
引用
@article{arxiv.2404.09216,
title = {DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection},
author = {Lewei Yao and Renjie Pi and Jianhua Han and Xiaodan Liang and Hang Xu and Wei Zhang and Zhenguo Li and Dan Xu},
journal= {arXiv preprint arXiv:2404.09216},
year = {2024}
}
备注
Accepted to CVPR2024