中文

NegVQA:视觉语言模型能否理解否定?

计算与语言 2025-05-30 v1 人工智能 计算机视觉与模式识别 计算机与社会 机器学习

摘要

否定是一种基本的语言现象,能够完全反转句子的含义。随着视觉语言模型不断进步并应用于高风险场景,评估其理解否定的能力变得至关重要。为此,我们引入了 NegVQA,这是一个视觉问答(VQA)基准,包含 7,379 道双选问题,涵盖多样的否定场景与图像-问题分布。我们利用大语言模型从现有 VQA 数据集中生成问题的否定版本来构建 NegVQA。我们对七个模型家族的 20 个最先进的 VLM 进行了评估,发现这些模型在处理否定时存在显著困难,与其对原始问题的回答相比表现出显著的性能下降。此外,我们发现了一个 U 型缩放趋势,即增大模型规模最初会降低在 NegVQA 上的性能,随后才带来改善。我们的基准揭示了 VLM 在否定理解方面的关键缺陷,并为未来 VLM 的发展提供了见解。项目页面:https://yuhui-zh15.github.io/NegVQA/。

关键词

引用

@article{arxiv.2505.22946,
  title  = {NegVQA: Can Vision Language Models Understand Negation?},
  author = {Yuhui Zhang and Yuchang Su and Yiming Liu and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2505.22946},
  year   = {2025}
}

备注

Published at ACL 2025 Findings