中文

大型视觉语言模型如何看见图像中的文字?揭示 OCR 头的独特作用

计算机视觉与模式识别 2025-10-01 v2

摘要

尽管在大型视觉语言模型(LVLMs)方面取得了显著进展,但仍存在解释性差的问题,尤其是如何定位和解释图像中嵌入的文本信息。本文我们探索了各种 LVLMs,以识别图像中文本的特定 heads,我们称之为 Optical Character Recognition Head(OCR Head)。我们对这些 heads 的发现如下:(1) 稀疏性较差:与先前的检索 heads 不同,大量 heads 被激活来提取图像中的文本信息。(2) 定性不同:OCR heads 具备与常规检索 heads 显著不同的特性,表现出低相似性。(3) 静态激活:这些 heads 的激活频率与其 OCR 分数 closely align。我们通过对 OCR 和常规检索 heads 应用链式思考(CoT)以及遮蔽这些 heads 来验证了这些发现于下游任务。我们还展示了在 OCR heads 中重新分配 sink-token values 可提高性能。这些见解提供了对 LVLMs 在处理图像中嵌入文本信息内部机制的更深入理解。

关键词

引用

@article{arxiv.2505.15865,
  title  = {How Do Large Vision-Language Models See Text in Image? Unveiling the Distinctive Role of OCR Heads},
  author = {Ingeol Baek and Hwan Chang and Sunghyun Ryu and Hwanhee Lee},
  journal= {arXiv preprint arXiv:2505.15865},
  year   = {2025}
}

备注

EMNLP 2025 Oral