探究上下文视觉语言绑定的机制
计算机视觉与模式识别
2025-05-29 v1 人工智能
摘要
为了理解提示,视觉语言模型 (VLM) 必须感知图像、理解文本,并在两种模态内部及跨模态之间建立关联。例如,给定一张“红色玩具车的图像”,模型应将此图像与“车”、“红色玩具”、“红色物体”等短语相关联。Feng 和 Steinhardt 在 LLM 中提出了绑定 ID 机制,认为实体及其对应的属性 token 在模型激活中共享一个绑定 ID。我们使用一个合成数据集及要求模型将图像中的 3D 物体与其文本描述相关联的任务,在 VLM 中研究了图像-文本绑定的这一机制。我们的实验表明,VLM 会为物体的图像 token 及其文本指派一个独特的绑定 ID,从而实现上下文关联。
引用
@article{arxiv.2505.22200,
title = {Investigating Mechanisms for In-Context Vision Language Binding},
author = {Darshana Saravanan and Makarand Tapaswi and Vineet Gandhi},
journal= {arXiv preprint arXiv:2505.22200},
year = {2025}
}
备注
Accepted to MIV at CVPRW 2025 (Oral)