教导视觉语言模型从上下文示例中定位特定物体
计算机视觉与模式识别
2025-03-14 v2
摘要
视觉语言模型(VLMs)在包括图像识别、视频理解和视觉问答(VQA)在内的多种视觉任务中展现出了卓越的能力(当针对这些任务进行显式训练时)。尽管取得了这些进展,我们发现当今的 VLMs(包括专有的 GPT-4o)缺乏一项基本的认知能力:即通过考虑上下文来学习定位场景中的特定物体。在本工作中,我们专注于少样本个性化定位任务,其中模型被给定一小批带标注的图像(上下文示例)——每张图像都有一个类别标签和边界框——其任务是在查询图像中定位同一类型的物体。当存在多个相关物体的歧义,或者物体难以用文字描述时,个性化定位尤为重要。为了激发模型的个性化定位能力,我们提出了一种以数据为中心的解决方案,利用从视频物体跟踪数据集中精心筛选的数据对模型进行微调。通过利用在多个镜头中跟踪同一物体的帧序列,我们模拟了促进上下文感知的指令微调对话。为了强化这一点,我们引入了一种新颖的正则化技术,用伪名称替换物体标签,确保模型依赖视觉上下文而非先验知识。我们的方法显著增强了从 7B 到 72B 大小不等的最新 VLMs 的少样本定位性能,且如在几个专为评估个性化定位能力而设计的基准上所展示的,未牺牲泛化能力。这项工作首次探索并对 VLMs 的个性化少样本定位进行了基准测试——揭示了当今 VLMs 的关键弱点,并为未来在上下文驱动的视觉语言应用中的研究奠定了基础。
引用
@article{arxiv.2411.13317,
title = {Teaching VLMs to Localize Specific Objects from In-context Examples},
author = {Sivan Doveh and Nimrod Shabtay and Wei Lin and Eli Schwartz and Hilde Kuehne and Raja Giryes and Rogerio Feris and Leonid Karlinsky and James Glass and Assaf Arbelle and Shimon Ullman and M. Jehanzeb Mirza},
journal= {arXiv preprint arXiv:2411.13317},
year = {2025}
}