中文

否定在视觉语言模型中的几何问题

计算机视觉与模式识别 2026-04-06 v2

摘要

诸如 CLIP 等联合视觉语言嵌入模型在理解文本查询中的否定方面常常失败,例如,无法区分查询 "a plain blue shirt with no logos" 中的 "no"。先前工作主要通过数据中心方法解决这一限制,即在大规模合成否定数据集上微调 CLIP。然而,这些努力常常使用基于检索的指标进行评估,这些指标无法可靠反映否定是否被实际理解。在本文中,我们确定了此类评估指标的两个关键局限性,并研究了一种基于 Multimodal LLM 评估框架的替代方案,这些模型通常在理解关于图像内容的简单是/否问题方面表现出色,为 CLIP 模型否定理解提供了公平的评估。我们随后询问是否存在 CLIP 嵌入空间中与否定相关的方向。我们发现有证据表明存在此类方向,并通过 representation engineering 在测试时干预此方向,以引导 CLIP 具备否定感知能力,而无需任何 fine-tuning。最后,我们在非常见图像-文本样本上测试否定理解,以评估分布迁移下的泛化能力。代码位于 https://github.com/fawazsammani/negation-steering

引用

@article{arxiv.2603.20554,
  title  = {When Negation Is a Geometry Problem in Vision-Language Models},
  author = {Fawaz Sammani and Tzoulio Chamiti and Paul Gavrikov and Nikos Deligiannis},
  journal= {arXiv preprint arXiv:2603.20554},
  year   = {2026}
}

备注

Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026