中文

视觉变为文本:定位视觉语言模型中的OCR路由瓶颈

计算与语言 2026-05-18 v3

摘要

视觉语言模型(VLMs)可以从图像中读取文本,但这种光学字符识别(OCR)信息进入语言处理流水线的具体位置在哪里?我们通过因果干预研究了 Qwen3-VL、Phi-4、InternVL3.5 三个架构族中的 OCR 路由机制。通过计算原始图像与文本填充版本之间的激活差异,我们识别出特定于架构的 OCR 瓶颈,其主导位置取决于视觉-语言集成策略:DeepStack 模型(Qwen)显示出在场景文本上呈现出约 50% 的中深度层最敏感,而单阶段投影模型(Phi-4、InternVL)在早期层(6-25%)中呈现最高敏感性,尽管最大效应层在不同数据集之间略有差异。OCR 信号异常低维:PC1 可解释最高达 72.9% 的方差。关键的是,主成分分析(PCA)在一个数据集上学习到的方向可传递到其他数据集,这表明存在共享的文本处理路径。令人意外的是,在具有模块化 OCR 电路(尤其是 Qwen3-VL-4B)的模型中,OCR 移除可提升计数性能(最高可提升 6.9 个百分点),这表明在足够模块化的架构中,OCR 可能干扰了其他视觉处理。

关键词

引用

@article{arxiv.2602.22918,
  title  = {Where Vision Becomes Text: Locating the OCR Routing Bottleneck in Vision-Language Models},
  author = {Jonathan Steinberg and Oren Gal},
  journal= {arXiv preprint arXiv:2602.22918},
  year   = {2026}
}