中文

NoOVD:面向开放词汇目标检测的新类别发现与嵌入

计算机视觉与模式识别 2026-03-24 v1

摘要

尽管开放词汇目标检测(OVD)取得了显著进展,但训练与测试之间仍存在显著差距。在训练期间,RPN和RoI头经常将无标签的新类别目标误分类为背景,导致一些提案在RPN过程中被提前过滤,其他提案则在RoI头中进一步误分类。在测试期间,这些提案再次获得低分数并在后处理中被移除,导致召回率显著下降,从而削弱了新类别检测性能。为解决这些问题,我们提出了一种新训练框架-NoOVD-其创新性地集成了基于冻结视觉语言模型(VLMs)知识的自教学习机制。具体而言,我们设计了K-FPN,利用预训练VLMs的知识引导模型发现新类别目标并促进知识蒸馏-无需额外数据-从而防止新对象被强制对齐到背景。此外,我们引入了R-RPN,该方法在推理期间调整提案的置信度得分,以提高新类别目标的召回率。跨数据集的评估在OV-LVIS、OV-COCO和Objects365上表明,我们的方法在多个指标上均实现了优异的性能。

关键词

引用

@article{arxiv.2603.21069,
  title  = {NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection},
  author = {Yupeng Zhang and Ruize Han and Zhiwei Chen and Wei Feng and Liang Wan},
  journal= {arXiv preprint arXiv:2603.21069},
  year   = {2026}
}

备注

CVPR 2026 Accept