中文

GlotOCR 基准:OCR 模型在十余种 Unicode 脚本以上仍难以应对

计算与语言 2026-04-15 v1 计算机视觉与模式识别

摘要

光学字符识别(OCR)随着视觉-语言模型的崛起取得了快速进展,但评估仍集中于少数高-中资源脚本。我们引入 GlotOCR 基准,对 OCR 在 100 多种 Unicode 脚本上的泛化能力进行全面评估。基准包含从真实多语言文本渲染而来的干净与退化图像变体。图像使用来自 Google Fonts 仓库的字体进行渲染,借助 HarfBuzz 进行文本排版,采用 FreeType 进行光栅化,支持 LTR 与 RTL 脚本。渲染图像样本经人工审核,确保所有脚本均正确渲染。我们评估了广泛的开源权重模型和专有视觉-语言模型,发现大多数模型仅在不足十种脚本上表现良好,即便是最强的前沿模型也难以泛化到三十多种脚本以上的表现。性能大致遵循脚本级别预训练覆盖率的趋势,表明当前 OCR 系统在很大程度上依赖语言模型预训练而非仅靠视觉识别。面对不熟悉脚本的模型要么产生随机噪声,要么从其已知类似脚本中幻觉出字符。我们发布基准及其管道以便复现。管道代码:https://github.com/cisnlp/glotocr-bench,基准:https://hf.co/datasets/cis-lmu/glotocr-bench。

关键词

引用

@article{arxiv.2604.12978,
  title  = {GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts},
  author = {Amir Hossein Kargaran and Nafiseh Nikeghbal and Jana Diesner and François Yvon and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2604.12978},
  year   = {2026}
}