中文

MQADet:用于增强开放词表目标检测的多模态问答范式

计算机视觉与模式识别 2025-02-27 v2

摘要

开放词表目标检测 (OVD) 是一种从未受训练限制的类别集合中检测和分类目标的具有挑战性的任务。现有的开放词表检测器受到复杂的视觉-文本错位和长尾类别不平衡的限制,导致在具有挑战性的情境下性能不佳。为解决这些限制,我们引入了 MQADet,这是一种通过利用多模态大型语言模型 (MLLMs) 的跨模态推理能力来增强现有开放词表检测器的通用范式。MQADet 作为即插即用解决方案,可无需额外大量训练地与预训练目标检测器无缝集成。具体而言,我们设计了一种新颖的三阶段多模态问答 (MQA) 流程,以引导 MLLMs 对复杂的文本和视觉目标进行精确定位,并有效增强现有目标检测器对相关目标的关注。为验证我们的方法,我们在四个具有挑战性的开放词表数据集上采用三种最先进的目标检测器作为基线。实验结果表明,我们提出的范式显著提高了现有检测器的性能,尤其是在未见的复杂类别中,能够在多样化且具有挑战性的情境下取得优异成绩。为促进未来研究,我们将公开发布代码。

关键词

引用

@article{arxiv.2502.16486,
  title  = {MQADet: A Plug-and-Play Paradigm for Enhancing Open-Vocabulary Object Detection via Multimodal Question Answering},
  author = {Caixiong Li and Xiongwei Zhao and Jinhang Zhang and Xing Zhang and Qihao Sun and Zhou Wu},
  journal= {arXiv preprint arXiv:2502.16486},
  year   = {2025}
}