中文

CLIP-Joint-Detect:基于对比视觉-语言监督的目标检测器端到端联合训练

计算机视觉与模式识别 2025-12-30 v1

摘要

传统的目标检测器依赖于交叉熵分类,这容易受到类别不平衡和标签噪声的影响。我们提出了 CLIP-Joint-Detect,这是一个简单且与检测器无关的框架,通过端到端联合训练集成了 CLIP 式的对比视觉-语言监督。一个轻量级的并行头将区域或网格特征投影到 CLIP 嵌入空间中,并通过 InfoNCE 对比损失和辅助交叉熵项将其与可学习的特定类别文本嵌入对齐,同时优化所有标准检测损失。该方法可无缝应用于双阶段和单阶段架构。我们使用 Faster R-CNN 在 Pascal VOC 2007+2012 上,以及使用现代 YOLO 检测器(YOLOv11)在大规模 MS COCO 2017 基准上对其进行了验证,在保持实时推理速度的同时,取得了一致且显著的改进。大量实验和消融研究表明,使用可学习文本嵌入的联合优化显著提升了跨不同架构和数据集的闭集检测性能。

关键词

引用

@article{arxiv.2512.22969,
  title  = {CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision},
  author = {Behnam Raoufi and Hossein Sharify and Mohamad Mahdee Ramezanee and Khosrow Hajsadeghi and Saeed Bagheri Shouraki},
  journal= {arXiv preprint arXiv:2512.22969},
  year   = {2025}
}

备注

6 pages, 4 figures. Preprint under review