LLMDet:在大语言模型监督下学习强开放词汇目标检测器
计算机视觉与模式识别
2025-02-03 v1
摘要
最近的开放词汇检测器通过丰富的区域级标注数据取得了有前景的性能。在这项工作中,我们表明,通过为每张图像生成图像级详细描述,与大语言模型协同训练的开放词汇检测器可以进一步提高性能。为实现这一目标,我们首先收集了一个数据集GroundingCap-1M,其中每张图像都附有相关的接地标签和图像级详细描述。利用该数据集,我们微调了一个开放词汇检测器,训练目标包括标准接地损失和描述生成损失。我们利用大语言模型为每个感兴趣区域生成区域级短描述,并为整个图像生成图像级长描述。在大语言模型的监督下,得到的检测器LLMDet以明显优势优于基线,具有卓越的开放词汇能力。此外,我们表明改进后的LLMDet反过来可以构建更强的大多模态模型,实现互惠互利。代码、模型和数据集可在https://github.com/iSEE-Laboratory/LLMDet获取。
引用
@article{arxiv.2501.18954,
title = {LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models},
author = {Shenghao Fu and Qize Yang and Qijie Mo and Junkai Yan and Xihan Wei and Jingke Meng and Xiaohua Xie and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2501.18954},
year = {2025}
}