用于端到端开放词汇目标检测的提示引导Transformer
计算机视觉与模式识别
2023-03-28 v1
摘要
Prompt-OVD是一个高效且有效的开放词汇目标检测框架,它利用来自CLIP的类嵌入作为提示,引导Transformer解码器检测基类和未知类中的对象。此外,我们新颖的基于RoI的掩码注意力和RoI剪枝技术有助于发挥基于Vision Transformer的CLIP的零样本分类能力,从而以最小的计算成本提升检测性能。我们在OV-COCO和OVLVIS数据集上的实验表明,Prompt-OVD的推理速度比首个端到端开放词汇检测方法(OV-DETR)快21.2倍,同时在相似推理时间范围内运行的四个两阶段方法上取得了更高的AP。代码将很快公开。
引用
@article{arxiv.2303.14386,
title = {Prompt-Guided Transformers for End-to-End Open-Vocabulary Object Detection},
author = {Hwanjun Song and Jihwan Bang},
journal= {arXiv preprint arXiv:2303.14386},
year = {2023}
}
备注
version 1