中文

探索评估者视觉语言模型中的盲点

计算机视觉与模式识别 2026-04-24 v1 计算与语言

摘要

大型视觉语言模型(VLM)日益被用于评估其他模型的输出,涉及图像到文本(I2T)任务如视觉问答,以及文本到图像(T2I)生成任务。尽管存在这种日益增长的依赖,但这些评估者VLM的可靠性仍未得到充分探讨。本文系统评估了评估者VLM在I2T和T2I任务中的可靠性。我们引入了针对性扰动,以测试关键错误维度,包括对象幻觉、空间推理、事实 grounding和视觉保真度。这些扰动测试评估者VLM是否可靠地考虑到这些质量降低错误。我们构建了包含4000多个扰动实例、覆盖40个扰动维度的全面基准,评估4个主流VLM,采用单答案评分、两两比较和参考引导的范式。我们的发现表明,当前的VLM评估者存在显著盲点:它们往往无法检测到被扰动的输出——在某些情况下超过50%,尤其在细粒度组合和空间错误方面表现尤为糟糕,对与输入图像矛盾的幻觉内容也往往不敏感。两两比较方法更可靠,但仍存在失败率。这些结果凸显了当前评估者VLM不可靠的本质,敬请谨慎在基准测试和开发决策中部署这些模型。代码和数据已公开提供。

关键词

引用

@article{arxiv.2604.21523,
  title  = {Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models},
  author = {Mohammed Safi Ur Rahman Khan and Sanjay Suryanarayanan and Tushar Anand and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2604.21523},
  year   = {2026}
}