中文

借助人类色觉缺陷方法诊断视觉语言模型的感知能力

计算机视觉与模式识别 2026-01-29 v2 计算与语言

摘要

大规模视觉-语言模型(LVLMs)正被部署在需要视觉推理的现实场景中。随着能力的提升,导航、教育和无障碍访问等应用正变得可行。这些场景需要适应感知差异,而非假设统一的视觉体验。颜色感知说明了这一需求:它是视觉理解的核心,但因色觉缺陷而在个体间存在差异,而这一方面在多模态 AI 中在很大程度上被忽视。在本工作中,我们研究了 LVLMs 是否能利用 Ishihara 测试来解释颜色感知的差异。我们通过生成、置信度和内部表示来评估模型行为,使用 Ishihara 图板作为受控刺激以揭示感知差异。尽管模型具备关于色觉缺陷的事实知识并能描述该测试,但它们无法重现受影响个体所经历的感知结果,而是默认采用规范化的颜色感知。这些结果表明当前系统缺乏表示替代性感知体验的机制,引发了对多模态设置中无障碍性和包容性部署的担忧。

关键词

引用

@article{arxiv.2505.17461,
  title  = {Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies},
  author = {Kazuki Hayashi and Shintaro Ozaki and Yusuke Sakai and Hidetaka Kamigaito and Taro Watanabe},
  journal= {arXiv preprint arXiv:2505.17461},
  year   = {2026}
}

备注

Accepted to appear in the main conference of EACL 2026