中文

HDINO:一个简洁高效的通用语义检测器

计算机视觉与模式识别 2026-03-04 v1

摘要

尽管近年来对开放词汇目标检测感兴趣增长,但大多数现有方法依赖于人工精细构建的训练数据集,以及资源密集型的层级跨模态特征提取。在本文中,我们提出了 HDINO,一个简洁且高效的开放词汇目标检测器,旨在消除对这些组件的依赖。具体而言,我们基于基于变换器的 DINO 模型提出了两个阶段的训练策略。在第一个阶段,将噪声样本视为额外的正目标实例,以构建视觉模态与文本模态之间的一对多语义对齐机制(O2M),从而促进语义对齐。还根据初始检测难度设计了基于难度加权分类损失(DWCL),以挖掘硬示例并进一步提高模型性能。在第二个阶段,应用轻量级特征融合模块,以增强对语言语义的敏感性。在 Swin Transformer-T 设置下,HDINO-T 在使用来自两个公开检测数据集的 220 万训练图像时,即可在 COCO 上实现 \textbf{49.2} mAP,无需任何人工数据整理和使用 grounding 数据,超过 Grounding DINO-T 和 T-Rex2 分别提升 \textbf{0.8} mAP 和 \textbf{2.8} mAP(后者分别在 540 万和 650 万图像上训练)。在 COCO 上进行微调后,HDINO-T 和 HDINO-L 分别进一步实现 \textbf{56.4} mAP 和 \textbf{59.2} mAP,凸显了该方法的有效性和可扩展性。代码和模型均可在 https://github.com/HaoZ416/HDINO 上获取。

关键词

引用

@article{arxiv.2603.02924,
  title  = {HDINO: A Concise and Efficient Open-Vocabulary Detector},
  author = {Hao Zhang and Yiqun Wang and Qinran Lin and Runze Fan and Yong Li},
  journal= {arXiv preprint arXiv:2603.02924},
  year   = {2026}
}