用于开放词汇目标检测的循环对比知识迁移
计算机视觉与模式识别
2025-04-03 v2
摘要
为了检测超出预定义类别的无限制目标,开放词汇目标检测(OVD)的现有技术通常求助于预训练的视觉语言模型(VLMs)以实现从基础类别到新类别的泛化。然而,为了缓解上游图像-文本预训练与下游区域级感知之间的错位,额外的监督是必不可少的,例如,图像-文本对或通过自训练策略生成的伪标注。在本工作中,我们提出了无需任何额外监督训练的 CCKT-Det。所提出的框架构建了从语言查询和从 VLMs 提取的视觉区域特征之间的循环动态知识迁移,迫使检测器紧密对齐 VLMs 的视觉-语义空间。具体而言,1)我们预过滤并注入语义先验以指导查询的学习,以及 2)引入区域对比损失以提高查询对新目标的感知能力。随着 VLMs 规模的增加,CCKT-Det 可以持续提升性能,同时仅需要检测器付出适度的计算开销。全面的实验结果表明,在没有和有更强教师模型的情况下,我们的方法在具有挑战性的 COCO 基准上分别比之前的 SOTA 取得了 +2.9% 和 +10.2% AP50 的性能提升。
引用
@article{arxiv.2503.11005,
title = {Cyclic Contrastive Knowledge Transfer for Open-Vocabulary Object Detection},
author = {Chuhan Zhang and Chaoyang Zhu and Pingcheng Dong and Long Chen and Dong Zhang},
journal= {arXiv preprint arXiv:2503.11005},
year = {2025}
}
备注
10 pages, 5 figures, Published as a conference paper at ICLR 2025