中文

COUNTS:在分布迁移下对目标检测器和多模态大语言模型进行基准测试

计算机视觉与模式识别 2025-04-15 v1 人工智能

摘要

当前的目标检测器在面对分布迁移时常常表现显著下降。因此,目标检测器的 out-of-distribution (OOD) 泛化能力正受到越来越多的关注。尽管有这样的日益增长的兴趣,但仍缺乏一个大规模、综合且带有细粒度注释的数据集和评估基准,专门用于评估更复杂任务如目标检测和定位的 OOD 泛化。为填补这一空白,我们引入 COUNTS,一个大规模 OOD 数据集,包含目标级别注释。COUNTS 涵盖 14 种自然分布迁移,包含超过 22 万个样本,标注超过 119 万个边界框。利用 COUNTS,我们引入两个新基准:O(OD)2 和 OODG。O(OD)2 旨在通过在训练和测试数据之间使用受控分布迁移,全面评估目标检测器的 OOD 泛化能力。OODG 则旨在评估多模态大语言模型 (MLLM) 在定位任务中 OOD 泛化能力。我们的发现表明,尽管大型模型和大量预训练数据在 in-distribution (IID) 场景中显著提升了性能,但在 OOD 场景中,针对目标检测器和 MLLM 的性能仍存在显著的局限性和改进机会。在视觉定位任务中,即使是领先的 GPT-4o 和 Gemini-1.5 也仅能实现 56.7% 和 28.0% 的准确率。我们希望 COUNTS 能促进开发和评估能够在分布迁移下保持高性能的鲁棒目标检测器和 MLLM。

关键词

引用

@article{arxiv.2504.10158,
  title  = {COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts},
  author = {Jiansheng Li and Xingxuan Zhang and Hao Zou and Yige Guo and Renzhe Xu and Yilong Liu and Chuzhao Zhu and Yue He and Peng Cui},
  journal= {arXiv preprint arXiv:2504.10158},
  year   = {2025}
}