中文

基于生成式区域-语言预训练的通用开放式目标检测

计算机视觉与模式识别 2024-03-18 v1

摘要

近期研究聚焦于开放词汇目标检测任务,旨在超越训练期间标记的有限类别数量,在推理阶段检测由任意类别名称描述的对象。与传统目标检测相比,开放词汇目标检测大幅扩展了目标检测类别。然而,它依赖于计算图像区域与预训练视觉-语言模型的相似度与一组任意类别名称。这意味着尽管该任务具有开放本质,但仍需在推理阶段使用预定义的对象类别。这引出了一个问题:如果在推理阶段我们不了解具体的目标类别呢?本文提出了一种称为生成式开放式目标检测的新设定,这是一种更通用且更实际的问题。为此,我们将目标检测建模为生成问题,提出了名为 GenerateU 的简单框架,能够以自由形式检测密集目标并生成其名称。特别地,我们使用 Deformable DETR 作为区域提议生成器,配合语言模型将视觉区域翻译为对象名称。为评估自由形式目标检测任务,我们引入一种量化衡量生成结果性能的评估方法。广泛的实验表明,GenerateU 在零样本检测方面表现出色。例如,在 LVIS 数据集上,GenerateU 的结果相当于开放词汇目标检测方法 GLIP,尽管 GenerateU 在推理期间从未见过类别名称。代码已公开:https://github.com/FoundationVision/GenerateU。

关键词

引用

@article{arxiv.2403.10191,
  title  = {Generative Region-Language Pretraining for Open-Ended Object Detection},
  author = {Chuang Lin and Yi Jiang and Lizhen Qu and Zehuan Yuan and Jianfei Cai},
  journal= {arXiv preprint arXiv:2403.10191},
  year   = {2024}
}

备注

CVPR 2024