中文

ColorFoil:探讨大型视觉-语言模型中的色盲问题

计算机视觉与模式识别 2025-01-07 v2 计算与语言

摘要

尽管利用 Transformer 架构,大型视觉-语言(V&L)模型在甚至零样态设置下显示出前景表现,但有些研究表明,这些模型在处理复杂语言和视觉属性时鲁棒性不足。本文引入一种新型 V&L 基准测试 - ColorFoil,通过创建与颜色相关的幽灵(foil)来评估模型检测颜色(如红色、白色、绿色等)的感知能力。我们以零样态方式评估包括 CLIP、ViLT、GroupViT 和 BridgeTower 等七个最先进的 V&L 模型,并呈现出有趣的发现。实验结果表明,ViLT 和 BridgeTower 在色彩感知能力方面显著优于 CLIP 及其变体和 GroupViT。此外,CLIP 基于模型和 GroupViT 在区分人类正常色觉能力下视觉上差异较大的颜色方面存在困难。

关键词

引用

@article{arxiv.2405.11685,
  title  = {ColorFoil: Investigating Color Blindness in Large Vision and Language Models},
  author = {Ahnaf Mozib Samin and M. Firoz Ahmed and Md. Mushtaq Shahriyar Rafee},
  journal= {arXiv preprint arXiv:2405.11685},
  year   = {2025}
}