中文

视觉-语言模型中的颜色:CLIP 的缺陷

计算机视觉与模式识别 2025-02-10 v1 人工智能

摘要

本工作探讨了在 CLIP(对比语言-图像预训练)中颜色是如何编码的,该模型是目前人工智能领域最具影响力的视觉-语言模型 (VLM)。在为此任务创建的合成数据集上进行了不同实验后,我们得出结论:CLIP 能够为彩色视觉刺激分配正确的颜色标签,但我们发现了两个主要缺陷: 针对与颜色概念关联较弱的非彩色刺激存在明显偏差,因此白色、灰色和黑色很少被分配为颜色标签; 倾向于优先考虑文本而非其他视觉信息。在此,我们通过详尽的 Stroop 效应测试证明了这一点在颜色标注中具有高度显著性。为了寻找这些颜色缺陷的原因,我们在神经元层面分析了内部表示。我们得出结论,CLIP 存在大量对文本具有选择性的神经元,特别是在网络的最深层,而数量较少的多模态颜色神经元可能是正确理解颜色概念的关键。我们的研究强调了在神经网络中改进颜色表示机制的必要性,以促进对人类所理解颜色的更全面理解,从而提升像 CLIP 这样的多模态模型在真实场景中的有效性与多功能性。

关键词

引用

@article{arxiv.2502.04470,
  title  = {Color in Visual-Language Models: CLIP deficiencies},
  author = {Guillem Arias and Ramon Baldrich and Maria Vanrell},
  journal= {arXiv preprint arXiv:2502.04470},
  year   = {2025}
}

备注

6 pages, 10 figures, conference, Artificial Intelligence