能否用生成内容挑战开放词汇目标检测器在街景中的表现?
计算机视觉与模式识别
2025-07-01 v1
摘要
开放词汇目标检测器(如 Grounding DINO)在大规模、多样化的数据上进行训练,在具有挑战性的数据集上取得了卓越的性能。因此,如何发现其局限性尚不明确,而在安全关键应用中这一点尤为重要。真实世界的数据无法提供对模型泛化能力进行严格评估所需的充分控制。相比之下,合成生成的数据允许系统性地探索模型能力/泛化能力的边界。在本工作中,我们探讨两个研究问题:1)能否用生成的图像内容挑战开放词汇目标检测器?2)能否发现这些模型系统性的失效模式?为回答这些问题,我们设计了基于 stable diffusion 的两条自动化流水线,通过从 WordNet 和 ChatGPT 中采样多个名词,以高语义多样性对异常物体进行修复(inpainting)。在合成生成的数据上,我们评估并比较了多种开放词汇目标检测器以及一种经典目标检测器。合成数据源自两个真实世界数据集,即具有挑战性的分布外(OOD)检测基准 LostAndFound 以及 NuImages 数据集。我们的结果表明,修复(inpainting)能够在忽略物体方面对开放词汇目标检测器构成挑战。此外,我们发现开放词汇模型强烈依赖于物体位置,而非物体语义。这提供了一种系统性挑战开放词汇模型的方法,并为如何有效获取数据以改进这些模型提供了有价值的见解。
引用
@article{arxiv.2506.23751,
title = {Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?},
author = {Annika Mütze and Sadia Ilyas and Christian Dörpelkus and Matthias Rottmann},
journal= {arXiv preprint arXiv:2506.23751},
year = {2025}
}