可见却不可读:视觉语言模型在不同文字系统中的系统性盲点
计算机视觉与模式识别
2025-12-03 v5 人工智能
摘要
文字是一种通用的文化技术,它重新利用视觉进行符号交流。人类表现出惊人的韧性:即使字符被碎片化、融合或部分遮挡,我们也能轻易识别出单词。本文研究先进的视觉语言模型是否具有这种韧性。我们通过拼接、重组和叠加字形,构建了两个受心理物理学启发的基准,涵盖不同的文字系统(中文语素文字和英文字母单词),为模型生成对人类仍可辨认但“可见却不可读”的刺激。尽管在干净文本上表现强劲,当代 VLM 在这些扰动下表现出严重的性能下降,经常产生无关或不连贯的输出。这一模式表明了一种结构性局限:模型严重依赖通用视觉不变性,却未能充分利用鲁棒文字识别所需的组合先验。我们发布了刺激生成代码、提示和评估协议,以促进透明的复现和后续工作。我们的发现推动了对跨文字系统编码符号分割、组合和绑定的架构与训练策略的研究,并为在教育、无障碍、文化遗产和安全领域部署多模态系统界定了具体挑战。
引用
@article{arxiv.2509.06996,
title = {Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems},
author = {Jie Zhang and Ting Xu and Gelei Deng and Runyi Hu and Han Qiu and Tianwei Zhang and Qing Guo and Ivor Tsang},
journal= {arXiv preprint arXiv:2509.06996},
year = {2025}
}
备注
arXiv admin note: This article has been withdrawn by arXiv administrators due to violation of arXiv policy regarding generative AI authorship