重新审视基于视觉语言模型的少样本目标检测
摘要
在互联网规模数据集上训练的视觉语言模型(VLM)时代挑战了“开放世界”感知的传统定义。在这项工作中,我们重新审视了在最近的基础VLM背景下的少样本目标检测(FSOD)任务。首先,我们指出,像GroundingDINO这样的VLM的零样本预测在COCO上显著优于最先进的少样本检测器(48 vs. 33 AP)。尽管这些基础模型具有强大的零样本性能,但它们可能仍然不是最优的。例如,网络上的卡车可能与目标应用(如自动驾驶车辆感知)中定义的卡车不同。我们认为,少样本识别任务可以重新表述为使用少量示例将基础模型与目标概念对齐。有趣的是,这些示例可以是多模态的,同时使用文本和视觉线索,模拟在定义感兴趣的目标概念时经常给人类标注者的指令。具体来说,我们提出了Foundational FSOD,一种新的基准协议,评估在任何外部数据上预训练并在每个目标类别的多模态(文本和视觉)K-shot示例上微调的检测器。我们重新利用nuImages进行Foundational FSOD,对几个流行的开源VLM进行基准测试,并对最先进的方法进行实证分析。最后,我们讨论了我们最近的CVPR 2024 Foundational FSOD竞赛,并分享来自社区的见解。值得注意的是,获胜团队以23.3 mAP显著优于我们的基线!我们的代码和数据集分割可在https://github.com/anishmadan23/foundational_fsod获取。
引用
@article{arxiv.2312.14494,
title = {Revisiting Few-Shot Object Detection with Vision-Language Models},
author = {Anish Madan and Neehar Peri and Shu Kong and Deva Ramanan},
journal= {arXiv preprint arXiv:2312.14494},
year = {2024}
}
备注
The first two authors contributed equally. This work has been accepted to the Neural Information Processing Systems (NeurIPS) 2024 Datasets & Benchmark Track