中文

无需训练的猜猜看视觉语言模型:从片段到开放词汇目标检测

计算机视觉与模式识别 2026-01-22 v2

摘要

开放词汇目标检测(Open-Vocabulary Object Detection, OVOD)旨在发展检测任意物体的能力。尽管大量大规模预训练工作已构建出多功能的基础模型,展现出令人印象深刻的零样本能力以促进 OVOD,但根据已预训练的基础模型为任意物体认知创建通用理解的需求通常被忽视。因此,本文提出一种无需训练的猜猜看视觉语言模型(Guess What Vision Language Model, GW-VLM),基于我们精心设计的用于 OVOD 的多尺度视觉语言搜索(Multi-Scale Visual Language Searching, MS-VLS)与上下文概念提示(Contextual Concept Prompt, CCP),形成一个通用理解范式。该方法能让预训练的视觉语言模型(VLM)和大语言模型(LLM)参与“猜猜看”游戏。其中,MS-VLS 利用多尺度视觉-语言软对齐使 VLM 从类别无关目标检测结果中生成片段,而 CCP 能形成参照 MS-VLS 的概念流,进而使 LLM 理解片段以进行 OVOD。最后,在自然和遥感数据集(包括 COCO val、Pascal VOC、DIOR 和 NWPU-10)上进行了大量实验,结果表明,我们提出的 GW-VLM 无需任何训练步骤,即可取得优于当前最先进方法的 OVOD 性能。

关键词

引用

@article{arxiv.2601.11910,
  title  = {A Training-Free Guess What Vision Language Model from Snippets to Open-Vocabulary Object Detection},
  author = {Guiying Zhu and Bowen Yang and Yin Zhuang and Tong Zhang and Guanqun Wang and Zhihao Che and He Chen and Lianlin Li},
  journal= {arXiv preprint arXiv:2601.11910},
  year   = {2026}
}