中文

IllusionBench+:面向视觉语言模型视觉错觉理解的大规模综合基准

计算机视觉与模式识别 2025-06-23 v2

摘要

当前的视觉语言模型 (VLMs) 展现出令人印象深刻的图像理解能力,但在视觉错觉方面存在困难,尤其是在真实世界场景中。现有的基准侧重于经典认知错觉,这些错觉已被最先进的 (SOTA) VLMs 所学习,暴露出幻觉和感知能力有限等问题。为了弥补这一差距,我们引入了 IllusionBench,这是一个全面的视觉错觉数据集,不仅包含经典认知错觉,还包含真实世界场景错觉。该数据集包含 1,051 张图像、5,548 个问答对和 1,051 个黄金文本描述,涉及错觉的存在、成因和内容。我们使用是非题、选择题和开放式任务在此数据集上评估了十个 SOTA VLMs。除了真实世界错觉外,我们还设计了在现实中不同但类似于经典模式的陷阱错觉,突显了 SOTA 模型中的幻觉问题。表现最佳的模型 GPT-4o 在是非题任务上达到了 80.59% 的准确率,在选择题上达到了 76.75%,但仍落后于人类表现。在语义描述任务中,GPT-4o 在经典错觉上的幻觉导致其在陷阱错觉上得分较低,甚至落后于一些开源模型。据我们所知,IllusionBench 是迄今为止 VLMs 中最大、最全面的视觉错觉基准。

关键词

引用

@article{arxiv.2501.00848,
  title  = {IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models},
  author = {Yiming Zhang and Zicheng Zhang and Xinyi Wei and Xiaohong Liu and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2501.00848},
  year   = {2025}
}