中文

阅读还是猜测?古希腊文版本OCR中视觉语言模型的视觉基础失败

计算与语言 2026-05-28 v1 人工智能 计算机视觉与模式识别 数字图书馆

摘要

近期研究表明,用于光学字符识别(OCR)的视觉语言模型(VLM)能生成看似合理但缺乏视觉支持的文本,暗示其依赖语言先验。通过将开源权重VLM与传统OCR基线在低资源古希腊文校勘本上进行对比,我们发现VLM的错误即使不正确也往往保持流畅,产生合理的希腊语替代词,而传统引擎则产生局部识别噪声。为分析解码过程中的视觉证据,我们引入了受控图像扰动和基于条件解码分布与无图像解码分布对比的令牌级基础度量。在字符级扰动下,VLM与扰动后的真实标签严重偏离,而传统OCR相对保持忠实;然而,令牌级分析表明先验依赖是模型特定的:在OCR专业模型中,流畅的词汇错误几乎不依赖图像产生,而通用VLM即使在错误时仍保持对视觉输入的依赖。解码时干预无法可靠恢复基础,而OCR后语言模型校正仅通过生成后修复文本改善了部分系统。我们的结果将OCR语言先验依赖的证据扩展至低资源历史文档和更广泛的模型集,表明流畅输出不一定具有视觉基础,并推动了超越聚合准确率的可解释性驱动评估。

关键词

引用

@article{arxiv.2605.27750,
  title  = {Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions},
  author = {Antonia Karamolegkou and Nicolas Angleraud and Benoît Sagot and Thibault Clérice},
  journal= {arXiv preprint arXiv:2605.27750},
  year   = {2026}
}