文本语音于视觉:ASCII 艺术揭示视觉语言模型中的文本偏见
计算机视觉与模式识别
2025-04-09 v2 人工智能
摘要
视觉语言模型(Vision-Language Models, VLMs)在处理多模态信息方面取得了快速进展,但其在跨模态冲突信号调和能力仍受到 insufficient 关注。本工作探讨了 VLMs 处理 ASCII 艺术的方式,这是一种独特的媒介,其中文本元素共同构成视觉图案,可能在语义与视觉之间创建冲突。我们引入了一种新型评估框架,系统性地挑战五个最先进的模型(包括 GPT-4o、Claude 和 Gemini),使用对抗性 ASCII 艺术,其中字符级语义刻意与全局视觉图案相矛盾。我们的实验揭示了强大的文本优先偏见:VLMs 持续优先考虑文本信息,视觉识别能力随语义复杂度的增加而显著下降。通过视觉参数调优和提示工程等各种缓解措施仅产生有限的改进,表明这一局限性需要来自架构层面的解决方案。这些发现揭示了当前 VLMs 整合多模态信息的根本性缺陷,为未来模型开发提供了重要指导,同时凸显了内容 moderation 系统易受对抗性示例影响的显著含义。
引用
@article{arxiv.2504.01589,
title = {Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models},
author = {Zhaochen Wang and Bryan Hooi and Yiwei Wang and Ming-Hsuan Yang and Zi Huang and Yujun Cai},
journal= {arXiv preprint arXiv:2504.01589},
year = {2025}
}
备注
Under review at COLM 2025