中文

YOLO-World:实时开放词汇目标检测

计算机视觉与模式识别 2024-02-23 v3

摘要

You Only Look Once(YOLO)系列检测器已成为高效实用的工具。然而,它们对预定义和训练好的目标类别的依赖限制了其在开放场景中的适用性。为了解决这一局限,我们引入了YOLO-World,这是一种创新方法,通过视觉-语言建模和大规模数据集上的预训练,增强了YOLO的开放词汇检测能力。具体来说,我们提出了一种新的可重参数化视觉-语言路径聚合网络(RepVL-PAN)和区域-文本对比损失,以促进视觉和语言信息之间的交互。我们的方法能够以零样本的方式高效地检测各种目标。在具有挑战性的LVIS数据集上,YOLO-World在V100上以52.0 FPS的速度达到了35.4 AP,在准确性和速度方面均优于许多当前最先进的方法。此外,微调后的YOLO-World在包括目标检测和开放词汇实例分割在内的多个下游任务上取得了卓越的性能。

关键词

引用

@article{arxiv.2401.17270,
  title  = {YOLO-World: Real-Time Open-Vocabulary Object Detection},
  author = {Tianheng Cheng and Lin Song and Yixiao Ge and Wenyu Liu and Xinggang Wang and Ying Shan},
  journal= {arXiv preprint arXiv:2401.17270},
  year   = {2024}
}

备注

Work still in progress. Code & models are available at: https://github.com/AILab-CVC/YOLO-World