中文

ColorBlindnessEval:视觉语言模型能否通过色盲测试?

计算机视觉与模式识别 2025-09-24 v1 计算与语言

摘要

本文提出 ColorBlindnessEval,一个新颖的基准,用于评估视觉语言模型(VLM)在受色盲测试启发的视觉对抗情境中的鲁棒性。数据集包含 500 个类似 Ishihara 色盲测试的图像,包含 0 到 99 的数字,具有不同的颜色组合,挑战 VLM 准确识别嵌入复杂视觉图案中的数值信息。我们评估了 9 个 VLM 使用是/否和开放式提示,并将其表现与人类参与者进行比较。我们的实验揭示了模型在对抗情境中解释数字的局限性,突显了常见的幻觉问题。这凸显了需要提高 VLM 在复杂视觉环境中鲁棒性的需求。ColorBlindnessEval 作为基准和改进 VLM 可靠性的工具,在实际应用中至关重要。

关键词

引用

@article{arxiv.2509.19070,
  title  = {ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?},
  author = {Zijian Ling and Han Zhang and Yazhuo Zhou and Jiahao Cui},
  journal= {arXiv preprint arXiv:2509.19070},
  year   = {2025}
}

备注

Accepted at the Open Science for Foundation Models (SCI-FM) Workshop at ICLR 2025