中文

DINO-X:面向开放世界目标检测与理解的统一视觉模型

计算机视觉与模式识别 2025-05-16 v3

摘要

本文介绍了DINO-X,这是由IDEA Research开发的目标中心统一视觉模型,目前具有最佳的开放世界目标检测性能。DINO-X采用与Grounding DINO 1.5相同的基于Transformer的编码器-解码器架构,以实现开放世界目标理解的目标级表示。为简化长尾目标检测,DINO-X扩展了输入选项,支持文本提示、视觉提示和自定义提示。基于这些灵活的提示,我们开发了一种通用目标提示,支持无提示的开放世界检测,使用户无需提供任何提示即可检测图像中的任意目标。为增强模型的基础定位能力,我们构建了包含超过1亿高质量定位样本的大规模数据集Grounding-100M,以提升模型的开放词汇检测性能。在此大规模数据上的预训练产生了基础目标级表示,使DINO-X能够集成多个感知头,同时支持检测、分割、姿态估计、目标描述、基于目标的问答等多种目标感知与理解任务。实验结果表明DINO-X具有优越性能。具体而言,DINO-X Pro模型在COCO、LVIS-minival和LVIS-val零样本检测基准上分别达到56.0 AP、59.8 AP和52.4 AP。值得注意的是,在LVIS-minival和LVIS-val的罕见类别上,其得分分别为63.3 AP和56.5 AP,将先前最先进水平提升了5.0 AP和5.0 AP。这凸显了其识别长尾目标的卓越能力。

关键词

引用

@article{arxiv.2411.14347,
  title  = {DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding},
  author = {Tianhe Ren and Yihao Chen and Qing Jiang and Zhaoyang Zeng and Yuda Xiong and Wenlong Liu and Zhengyu Ma and Junyi Shen and Yuan Gao and Xiaoke Jiang and Xingyu Chen and Zhuheng Song and Yuhong Zhang and Hongjie Huang and Han Gao and Shilong Liu and Hao Zhang and Feng Li and Kent Yu and Lei Zhang},
  journal= {arXiv preprint arXiv:2411.14347},
  year   = {2025}
}

备注

Technical Report