中文

分析视觉语言模型在视觉问答中的灵敏性

计算机视觉与模式识别 2025-07-30 v1

摘要

我们可将视觉问答视为人类与人工智能系统之间的(多模态)对话。本研究通过聚焦于格赖斯(Grice)提出的对话协作原则,探讨视觉语言模型 (VLMs) 的灵敏性。具体而言,即使格赖斯的对话准则被违反,人类通常也不会在需要更多认知努力的情况下难以理解对话。我们研究 VLMs 是否以类似人类的方式处理对话准则的违反。具体方法是向人类编写的问题添加修饰语,并分析 VLMs 对这些修饰语的响应。我们使用三种最先进的 VLMs 进行研究,即 GPT-4o、Claude-3.5-Sonnet 和 Gemini-1.5-Flash,测试数据来自 VQA v2.0 数据集。我们的初始结果表明,VLMs 的性能在添加修饰语后持续下降,这表明我们的方法是一个有前景的方向,用以理解 VLMs 的局限性。

关键词

引用

@article{arxiv.2507.21335,
  title  = {Analyzing the Sensitivity of Vision Language Models in Visual Question Answering},
  author = {Monika Shah and Sudarshan Balaji and Somdeb Sarkhel and Sanorita Dey and Deepak Venugopal},
  journal= {arXiv preprint arXiv:2507.21335},
  year   = {2025}
}