中文

通过协作基础模型增强新物体检测

计算机视觉与模式识别 2025-01-17 v4 人工智能 机器学习

摘要

在本工作中,我们解决新物体检测(NOD)这一具有挑战性且新兴的问题,聚焦于在推理时准确检测已知与新物体类别。传统物体检测算法本质上是闭集的,限制了其处理 NOD 的能力。我们提出一种新方法,将现有闭集检测器转化为开集检测器。该转化通过利用预训练基础模型(具体而言为 CLIP 与 SAM)的互补优势,经由我们的协作机制实现。此外,通过将此机制与 GDINO 等最先进开集检测器结合,我们在物体检测性能上确立了新基准。我们的方法在具有挑战性的 LVIS 数据集上取得 17.42 mAP 的新物体检测成绩与 42.08 mAP 的已知物体成绩。将我们的方法适配至 COCO OVD 划分,我们在新类别上以 7.2 AP50 \text{AP}_{50} 的优势超越当前最先进水平。我们的代码见 https://rohit901.github.io/coop-foundation-models/ 。

关键词

引用

@article{arxiv.2311.12068,
  title  = {Enhancing Novel Object Detection via Cooperative Foundational Models},
  author = {Rohit Bharadwaj and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2311.12068},
  year   = {2025}
}

备注

Accepted at WACV 2025