中文

通过处理背景样本提升开放词汇目标检测性能

计算机视觉与模式识别 2024-10-14 v1

摘要

开放词汇目标检测是指准确检测来自包含基础类别和新类别的候选词汇表中的目标对象的任务。目前,众多开放词汇检测器通过利用 CLIP 的零样能力取得了成功。然而,我们注意到 CLIP 模型在处理背景图像(即没有对应标签的图像)时难以有效处理。由于其语言-图像学习方法,这一局限性导致依赖 CLIP 的开放词汇检测器在处理背景样本时的性能次优。本文提出一种用于开放词汇检测的背景信息表示方法(Background Information Representation for open-vocabulary Detector,简称 BIRDet),以解决 CLIP 在处理背景样本方面的局限性。具体地,我们设计了背景信息建模(Background Information Modeling,简称 BIM),将主流开放词汇检测器中固定的单一背景嵌入替换为动态的场景信息,并将其引导为与图像相关的背景表示。该方法有效增强了将 oversized 区域分类为背景的能力。此外,我们引入了部分对象抑制(Partial Object Suppression,简称 POS)算法,利用重叠面积比来解决将部分区域误分类为前景的问题。在 OV-COCO 和 OV-LVIS 基准测试上的实验表明,我们提出的模型能够在各种开放词汇检测器上实现性能提升。

关键词

引用

@article{arxiv.2410.08645,
  title  = {Boosting Open-Vocabulary Object Detection by Handling Background Samples},
  author = {Ruizhe Zeng and Lu Zhang and Xu Yang and Zhiyong Liu},
  journal= {arXiv preprint arXiv:2410.08645},
  year   = {2024}
}

备注

16 pages, 5 figures, Accepted to ICONIP 2024