利用预训练 ViT 表示调制 CNN 特征以实现开放词汇目标检测
计算机视觉与模式识别
2025-03-07 v3
摘要
由于大规模图像-文本对比训练,预训练的视觉语言模型(VLM)如 CLIP 显示出优越的开放词汇识别能力。目前大多数开放词汇目标检测器试图利用预训练的 VLM 以实现通用表示。F-ViT 使用预训练的视觉编码器作为主干网络并在训练期间冻结它。然而,其冻结主干网络无法从标记数据中强化检测的表示。因此,我们提出一种新型双支路主干网络,称为 ViT-Feature-Modulated Multi-Scale Convolutional Network(VMCNet),由可训练的卷积支路、冻结的预训练 ViT 支路以及 VMC 模块组成。可训练的 CNN 支路可借助标记数据进行优化,而冻结的预训练 ViT 支路可保持来自大规模预训练的表示能力。然后,提出的 VMC 模块可调制来自 ViT 支路的多尺度 CNN 特征。通过这种混合结构,检测器更可能发现新类别的对象。我们在两个流行基准上进行评估,该方法在新类别检测性能方面提升,并优于最新方法。在 OV-COCO 上,本方法使用 ViT-B/16 和 ViT-L/14 获得 44.3 和 48.5 个 。在 OV-LVIS 上,VMCNet 使用 ViT-B/16 和 ViT-L/14 分别达到 27.8 和 38.4 个 。
引用
@article{arxiv.2501.16981,
title = {Modulating CNN Features with Pre-Trained ViT Representations for Open-Vocabulary Object Detection},
author = {Xiangyu Gao and Yu Dai and Benliu Qiu and Lanxiao Wang and Heqian Qiu and Hongliang Li},
journal= {arXiv preprint arXiv:2501.16981},
year = {2025}
}