中文

阅读 $\neq$ 看见:诊断和弥合视觉语言模型中的排版差距

计算机视觉与模式识别 2026-03-10 v1

摘要

视觉语言模型在图像中读取文本方面几乎达到完美准确率,然而在排版感知方面却大多不敏感:它们能够识别文本内容,却不能感知其外观。我们通过评估字体家族、大小、样式和颜色的识别,在 26 种字体、4 种脚本和 3 个难度等级下系统调查此差距。对 15 个最先进 VLMs 的评估显示出惊人的感知层级:颜色识别几乎完美,但字体样式检测普遍极差。我们进一步发现,模型规模无法预测性能,且准确率在难度等级之间均匀,这指向训练数据的缺失而非容量极限。对开源模型进行小规模合成样本的 LoRA 微调显著提升性能,缩小与最佳闭源系统的差距,并在字体大小识别上甚至超越。字体样式仍对微调抗压,表明关系式视觉推理可能需要超越当前 patch-based 编码器的架构创新。我们发布评估框架、数据和微调配方,以支持弥合视觉语言理解中排版差距的进展。

关键词

引用

@article{arxiv.2603.08497,
  title  = {Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models},
  author = {Heng Zhou and Ao Yu and Li Kang and Yuchen Fan and Yutao Fan and Xiufeng Song and Hejia Geng and Yiran Qin},
  journal= {arXiv preprint arXiv:2603.08497},
  year   = {2026}
}