中文

利用合成标题进行双曲学习的开放世界检测

计算机视觉与模式识别 2024-04-09 v1

摘要

开放世界检测提出了重大挑战,因为它要求使用对象类标签或自由形式文本来检测任何对象。现有的相关工作通常使用大规模人工标注的标题数据集进行训练,这些数据集的收集成本极高。相反,我们提出从视觉-语言模型转移知识以自动丰富开放词汇描述。具体来说,我们使用预训练的 VLMs 引导密集的合成标题,以提供对图像中不同区域的丰富描述,并将这些标题纳入训练以训练一个能够泛化到新概念的新型检测器。为了减轻合成标题中幻觉引起的噪声,我们还提出了一种新颖的双曲视觉-语言学习方法,以在视觉和标题嵌入之间施加层次结构。我们将我们的检测器称为“HyperLearner”。我们在各种开放世界检测基准(COCO、LVIS、Object Detection in the Wild、RefCOCO)上进行了大量实验,结果表明,在使用相同骨干网络的情况下,我们的模型始终优于现有的最先进方法,如 GLIP、GLIPv2 和 Grounding DINO。

关键词

引用

@article{arxiv.2404.05016,
  title  = {Hyperbolic Learning with Synthetic Captions for Open-World Detection},
  author = {Fanjie Kong and Yanbei Chen and Jiarui Cai and Davide Modolo},
  journal= {arXiv preprint arXiv:2404.05016},
  year   = {2024}
}

备注

CVPR 2024