中文

PIN:位置插入解锁视觉语言模型的目标定位能力

计算机视觉与模式识别 2024-02-14 v1

摘要

视觉语言模型(VLM),如 Flamingo 和 GPT-4V,通过将大语言模型与视觉系统集成,展现出了巨大的潜力。然而,由于这些模型在多模态数据上进行训练,而这些数据主要包含没有显式空间定位的描述,因此它们在目标定位这一基础计算机视觉任务中面临挑战。虽然可以构建带有边界框注释的自定义监督训练管道并与 VLM 集成,但这会导致模型专门化且难以扩展。在本文中,我们旨在探索基于描述的 VLM 的极限,并提议以更简单的方式应对这一挑战,即 i)保持基于描述的 VLM 权重冻结,ii)不使用任何监督检测数据。为此,我们引入了一种与输入无关的位置插入(PIN),这是一种可学习的空间提示,包含在冻结的 VLM 内部滑动的极小参数集,可解锁目标定位能力。我们的 PIN 模块在合成数据上通过简单的下一 token 预测任务进行训练,无需引入新的输出头。我们的实验在多种图像上展示了强大的零样本定位性能,包括 Pascal VOC、COCO、LVIS 以及绘画或卡通等多样化图像。

关键词

引用

@article{arxiv.2402.08657,
  title  = {PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs},
  author = {Michael Dorkenwald and Nimrod Barazani and Cees G. M. Snoek and Yuki M. Asano},
  journal= {arXiv preprint arXiv:2402.08657},
  year   = {2024}
}