中文

视觉语言模型看不到显而易见的东西

计算机视觉与模式识别 2025-07-08 v1

摘要

我们提出 Saliency Benchmark(SalBench),一个新颖的基准,用于评估大型视觉语言模型(LVLM)在检测人类轻易即可察觉的视觉显著特征(如大圆环在较小圆环网格中的位置)方面的能力。该基准聚焦于低层次特征,包括颜色、强度和方向,这些特征是人类视觉处理的基础。SalBench 包含突出稀有、异常或意外元素并自然吸引人类注意力的图像,包含三个用于评估 LVLM 感知能力的新任务:Odd-One-Out 检测、指称性 Odd-One-Out 检测和视觉指称性 Odd-One-Out 检测。我们对最新 LVLM 进行了全面评估,发现 LVLM 在识别看似显而易见的视觉异常方面存在惊人局限,甚至是高度发达的 GPT-4o 在此类简单任务上也仅达到 47.6% 的准确率。SalBench 将是衡量 LVLM 能力的重要步骤,这些能力与人类注意力的细微定义相吻合。

关键词

引用

@article{arxiv.2507.04741,
  title  = {Vision-Language Models Can't See the Obvious},
  author = {Yasser Dahou and Ngoc Dung Huynh and Phuc H. Le-Khac and Wamiq Reyaz Para and Ankit Singh and Sanath Narayan},
  journal= {arXiv preprint arXiv:2507.04741},
  year   = {2025}
}