学会说“不”以更好地说“是”:通过否定改进视觉语言模型
计算机视觉与模式识别
2025-03-13 v1
摘要
现有的视觉语言模型(VLM)将文本描述视为一个整体,混淆了提示中的单个概念,损害了视觉语义匹配和推理。逻辑和语言推理的一个重要方面是否定。本文强调了流行VLM(如CLIP)在理解否定含义(即给定提示中单词“not”的效果)方面的局限性。为了评估VLM在包含否定的流畅提示上的表现,我们提出了CC-Neg数据集,包含228,246张图像、真实描述及其对应的否定描述。使用CC-Neg以及对CLIP对比损失的修改,我们提出的CoN-CLIP框架对否定的理解得到了改进。这种训练范式提高了CoN-CLIP可靠编码语义的能力,在8个数据集的零样本图像分类中,top-1准确率平均提升3.85%。此外,CoN-CLIP在具有挑战性的组合性基准测试(如SugarCREPE)上比CLIP高出4.4%,展示了在文本中对象、关系和属性的新兴组合理解能力。总体而言,我们的工作通过引入一个数据集和框架来加强图像与文本之间的语义关联,解决了VLM的一个关键局限性,展示了改进的大规模基础模型,同时显著降低了计算成本,促进了效率和可访问性。
引用
@article{arxiv.2403.20312,
title = {Learn "No" to Say "Yes" Better: Improving Vision-Language Models via Negations},
author = {Jaisidh Singh and Ishaan Shrivastava and Mayank Vatsa and Richa Singh and Aparna Bharati},
journal= {arXiv preprint arXiv:2403.20312},
year = {2025}
}
备注
14 pages + 6 figures in main manuscript (excluding references)