针对 CVPR2024 Foundational Few-Shot Object Detection 挑战的解决方案
计算机视觉与模式识别
2024-06-19 v1
摘要
本报告介绍了一种增强方法,用于 Foundational Few-Shot Object Detection (FSOD) 任务,利用视觉语言模型 (VLM) 进行目标检测。然而,在特定数据集上,VLM 可能遇到检测目标与感兴趣目标概念不匹配的问题。这种不匹配阻碍了 VLM 的零样例性能以及基于伪标签的微调方法的应用。为解决此问题,我们提出 VLM+ 框架,集成多模态大型语言模型 (MM-LLM)。具体而言,我们使用 MM-LLM 为每个类别生成一系列指代表达式。基于 VLM 预测和给定注释,我们通过匹配最大 IoU 选取每个类别的最佳指代表达式。随后,我们利用这些指代表达式为训练集中所有图像生成伪标签,然后将其与原始标注数据合并进行微调。此外,我们采用迭代式伪标签生成与优化进一步提升 VLM 的性能。我们的方法在最终测试中实现了 32.56 mAP。
引用
@article{arxiv.2406.12225,
title = {The Solution for CVPR2024 Foundational Few-Shot Object Detection Challenge},
author = {Hongpeng Pan and Shifeng Yi and Shouwei Yang and Lei Qi and Bing Hu and Yi Xu and Yang Yang},
journal= {arXiv preprint arXiv:2406.12225},
year = {2024}
}
备注
CVPR2024 Foundational Few-Shot Object Detection Challenge