ColorBlindnessEval:视觉语言模型能否通过色盲测试?
计算机视觉与模式识别
2025-09-24 v1 计算与语言
摘要
本文提出 ColorBlindnessEval,一个新颖的基准,用于评估视觉语言模型(VLM)在受色盲测试启发的视觉对抗情境中的鲁棒性。数据集包含 500 个类似 Ishihara 色盲测试的图像,包含 0 到 99 的数字,具有不同的颜色组合,挑战 VLM 准确识别嵌入复杂视觉图案中的数值信息。我们评估了 9 个 VLM 使用是/否和开放式提示,并将其表现与人类参与者进行比较。我们的实验揭示了模型在对抗情境中解释数字的局限性,突显了常见的幻觉问题。这凸显了需要提高 VLM 在复杂视觉环境中鲁棒性的需求。ColorBlindnessEval 作为基准和改进 VLM 可靠性的工具,在实际应用中至关重要。
关键词
引用
@article{arxiv.2509.19070,
title = {ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?},
author = {Zijian Ling and Han Zhang and Yazhuo Zhou and Jiahao Cui},
journal= {arXiv preprint arXiv:2509.19070},
year = {2025}
}
备注
Accepted at the Open Science for Foundation Models (SCI-FM) Workshop at ICLR 2025