NoOVD:面向开放词汇目标检测的新类别发现与嵌入
计算机视觉与模式识别
2026-03-24 v1
摘要
尽管开放词汇目标检测(OVD)取得了显著进展,但训练与测试之间仍存在显著差距。在训练期间,RPN和RoI头经常将无标签的新类别目标误分类为背景,导致一些提案在RPN过程中被提前过滤,其他提案则在RoI头中进一步误分类。在测试期间,这些提案再次获得低分数并在后处理中被移除,导致召回率显著下降,从而削弱了新类别检测性能。为解决这些问题,我们提出了一种新训练框架-NoOVD-其创新性地集成了基于冻结视觉语言模型(VLMs)知识的自教学习机制。具体而言,我们设计了K-FPN,利用预训练VLMs的知识引导模型发现新类别目标并促进知识蒸馏-无需额外数据-从而防止新对象被强制对齐到背景。此外,我们引入了R-RPN,该方法在推理期间调整提案的置信度得分,以提高新类别目标的召回率。跨数据集的评估在OV-LVIS、OV-COCO和Objects365上表明,我们的方法在多个指标上均实现了优异的性能。
引用
@article{arxiv.2603.21069,
title = {NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection},
author = {Yupeng Zhang and Ruize Han and Zhiwei Chen and Wei Feng and Liang Wan},
journal= {arXiv preprint arXiv:2603.21069},
year = {2026}
}
备注
CVPR 2026 Accept