真实场景中的多模态查询目标检测
计算机视觉与模式识别
2023-10-10 v2
摘要
我们提出 MQ-Det,一种高效的架构与预训练策略设计,利用具有开放集泛化能力的文本描述与具有丰富描述粒度的视觉样本作为类别查询,即多模态查询(Multi-modal Queried)目标检测,用于兼具开放词汇类别与多种粒度的真实世界检测。MQ-Det 将视觉查询引入现有成熟的仅语言查询检测器。我们提出一种即插即用的门控类可扩展感知器模块,置于冻结检测器之上,以类级视觉信息增强类别文本。为解决冻结检测器带来的学习惯性问题,提出了视觉条件掩码语言预测策略。MQ-Det 简洁而有效的架构与训练策略设计与大多数语言查询目标检测器兼容,从而带来多样应用。实验结果表明,多模态查询大幅提升了开放世界检测。例如,MQ-Det 通过多模态查询在 LVIS 基准上将最先进开放集检测器 GLIP 显著提升 +7.8% AP,且无需任何下游微调,并在 13 个少样本下游任务上平均提升 +6.3% AP,仅增加 GLIP 所需 3% 的调制时间。代码见 https://github.com/YifanXu74/MQ-Det。
引用
@article{arxiv.2305.18980,
title = {Multi-modal Queried Object Detection in the Wild},
author = {Yifan Xu and Mengdan Zhang and Chaoyou Fu and Peixian Chen and Xiaoshan Yang and Ke Li and Changsheng Xu},
journal= {arXiv preprint arXiv:2305.18980},
year = {2023}
}