中文

OV-DINO:基于语言感知选择性融合的统一开放词汇检测

计算机视觉与模式识别 2024-07-23 v2

摘要

开放词汇检测因需基于类别名称检测对象(包括训练期未遇到的类别)而具有挑战性。现有方法通过在多样化大规模数据集上预训练和伪标签化,展现出强大的零样检测能力,但面临两个主要挑战:(i) 如何有效消除伪标签化中的数据噪声,(ii) 如何高效利用语言感知能力进行区域级别的跨模态融合和对齐。为此,我们提出一种新颖的统一开放词汇检测方法OV-DINO,在统一框架中进行语言感知选择性融合预训练。具体而言,我们引入统一数据集成(UniDI)管道,实现端到端训练,通过将不同数据源统一整合为检测中心数据格式来消除伪标签生成的噪声。此外,我们提出语言感知选择性融合(LASF)模块,通过语言感知查询选择和融合过程增强跨模态对齐。在流行的开放词汇检测基准上评估OV-DINO,零样检测下在COCO基准上达到50.6%的AP,在LVIS基准上达到40.1%的AP,显示出强大的泛化能力。此外,基于COCO微调的OV-DINO达到58.4%的AP,超越了许多使用相同主干网络的现有方法。OV-DINO的代码已公开于 https://github.com/wanghao9610/OV-DINO。

关键词

引用

@article{arxiv.2407.07844,
  title  = {OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion},
  author = {Hao Wang and Pengzhen Ren and Zequn Jie and Xiao Dong and Chengjian Feng and Yinlong Qian and Lin Ma and Dongmei Jiang and Yaowei Wang and Xiangyuan Lan and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2407.07844},
  year   = {2024}
}

备注

Technical Report