SpaceVLM:针对视觉语言模型中的否定进行子空间建模
计算机视觉与模式识别
2025-11-18 v1
摘要
视觉语言模型 (VLM) 在处理否定时存在困难。例如,给定“检索(或生成)街道场景而无行人”的提示,它们往往无法尊重“not”。现有方法通过在大型否定数据集上微调来解决此限制,但这种重新训练往往会损害模型在肯定提示上的零样本性能。我们展示了 VLM 的嵌入空间(如 CLIP)可以被划分为语义一致的子空间。基于这一属性,我们提出了一种无需训练的框架,将否定建模为联合嵌入空间中的一个子空间,而非单个点(图 1)。为了匹配类似“A 但非 N”的描述,我们在 A 和 N 的嵌入向量周围构造两个球形区域,并通过计算靠近 A 且远离 N 区域的中心方向来对图像进行评分。在检索、MCQ 和文本到图像任务中,我们的方法在先前方法上平均提高了约 30% 的否定理解能力。它弥合了肯定和否定提示之间的差距,同时保持了 fine-tuned 模型难以维持的零样本性能。代码将在发表后公开。
引用
@article{arxiv.2511.12331,
title = {SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models},
author = {Sepehr Kazemi Ranjbar and Kumail Alhamoud and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:2511.12331},
year = {2025}
}