中文

用于端到端开放词汇目标检测的提示引导Transformer

计算机视觉与模式识别 2023-03-28 v1

摘要

Prompt-OVD是一个高效且有效的开放词汇目标检测框架,它利用来自CLIP的类嵌入作为提示,引导Transformer解码器检测基类和未知类中的对象。此外,我们新颖的基于RoI的掩码注意力和RoI剪枝技术有助于发挥基于Vision Transformer的CLIP的零样本分类能力,从而以最小的计算成本提升检测性能。我们在OV-COCO和OVLVIS数据集上的实验表明,Prompt-OVD的推理速度比首个端到端开放词汇检测方法(OV-DETR)快21.2倍,同时在相似推理时间范围内运行的四个两阶段方法上取得了更高的AP。代码将很快公开。

关键词

引用

@article{arxiv.2303.14386,
  title  = {Prompt-Guided Transformers for End-to-End Open-Vocabulary Object Detection},
  author = {Hwanjun Song and Jihwan Bang},
  journal= {arXiv preprint arXiv:2303.14386},
  year   = {2023}
}

备注

version 1