中文

SpaceVLM:针对视觉语言模型中的否定进行子空间建模

计算机视觉与模式识别 2025-11-18 v1

摘要

视觉语言模型 (VLM) 在处理否定时存在困难。例如,给定“检索(或生成)街道场景而无行人”的提示,它们往往无法尊重“not”。现有方法通过在大型否定数据集上微调来解决此限制,但这种重新训练往往会损害模型在肯定提示上的零样本性能。我们展示了 VLM 的嵌入空间(如 CLIP)可以被划分为语义一致的子空间。基于这一属性,我们提出了一种无需训练的框架,将否定建模为联合嵌入空间中的一个子空间,而非单个点(图 1)。为了匹配类似“A 但非 N”的描述,我们在 A 和 N 的嵌入向量周围构造两个球形区域,并通过计算靠近 A 且远离 N 区域的中心方向来对图像进行评分。在检索、MCQ 和文本到图像任务中,我们的方法在先前方法上平均提高了约 30% 的否定理解能力。它弥合了肯定和否定提示之间的差距,同时保持了 fine-tuned 模型难以维持的零样本性能。代码将在发表后公开。

关键词

引用

@article{arxiv.2511.12331,
  title  = {SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models},
  author = {Sepehr Kazemi Ranjbar and Kumail Alhamoud and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2511.12331},
  year   = {2025}
}