视觉语言模型能否看见方格?文本识别在三大模型家族中的空间推理中发挥作用
计算机视觉与模式识别
2026-02-24 v2 机器学习
摘要
我们提出一个简单实验,暴露视觉语言模型(VLMs)的根本性局限:无法准确局部化那些缺乏文本身份标识的填充单元格。在我们生成的十五个15×15网格中,单元格填充率变化于10.7%-41.8%,将其渲染为两种图像类型——带文本符号(.和#)和无网格线的填充方块——然后要求三大前沿VLMs(Claude Opus、ChatGPT 5.2、Gemini 3 Thinking)对其进行转录。在文本符号条件下,Claude和ChatGPT分别实现约91%的单元格准确率和84%的F1分数,而Gemini实现84%的准确率和63%的F1分数。在填充方块条件下,所有三个模型准确率降至60%-73%,F1分数降至29%-39%。关键在于,所有条件都通过相同的视觉编码器——文本符号是图像而非分词文本。文本与方块的F1分数差距在不同模型之间范围为34-54分,表明VLMs行为就好像拥有高保真文本识别通道用于空间推理,这显著优于其本能的视觉通道。每个模型在方块条件下的不同故障模式——系统性低估计数(Claude)、大量高估计数(ChatGPT)以及模板幻觉(Gemini),但都共享同一根本性短板: severely 降低了非文本视觉元素的空间局部化能力。
引用
@article{arxiv.2602.15950,
title = {Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families},
author = {Yuval Levental},
journal= {arXiv preprint arXiv:2602.15950},
year = {2026}
}
备注
9 pages, 3 figures, 2 tables. Workshop-length paper