F-VLM:基于冻结视觉与语言模型的开放词汇目标检测
计算机视觉与模式识别
2023-02-27 v2
摘要
我们提出 F-VLM,一种构建于冻结视觉与语言模型之上的简单开放词汇目标检测方法。F-VLM 通过消除知识蒸馏或检测定制预训练的需求,简化了当前的多阶段训练流程。令人惊讶的是,我们观察到冻结的 VLM:1)保留了检测所需的局部敏感特征,且 2)是一个强大的区域分类器。我们仅微调检测头,并在推理时对每个区域的检测器和 VLM 输出进行组合。F-VLM 展现出引人注目的缩放特性,并在 LVIS 开放词汇检测基准的新类别上比先前最先进水平提高了 +6.5 mask AP。此外,我们在 COCO 开放词汇检测基准和跨数据集迁移检测上也展示了极具竞争力的结果,同时显著加快了训练速度并节省了计算量。代码将发布于 https://sites.google.com/view/f-vlm/home
引用
@article{arxiv.2209.15639,
title = {F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models},
author = {Weicheng Kuo and Yin Cui and Xiuye Gu and AJ Piergiovanni and Anelia Angelova},
journal= {arXiv preprint arXiv:2209.15639},
year = {2023}
}
备注
Accepted to ICLR 2023 (https://iclr.cc/Conferences/2023). 20 pages, 7 figures