中文

历史 OCR 中的错误模式:TrOCR 与视觉语言模型的比较分析

计算机视觉与模式识别 2026-02-17 v1

摘要

对 18 世纪印刷文本的光学字符识别(OCR)仍具有挑战性,主要由于印刷品质量下降、古老的字符形态以及非标准化的拼写规则。尽管基于转换器的 OCR 系统和视觉语言模型(VLM)在整体准确率方面取得了强劲的表现,但字符错误率(CER)和词错误率(WER)等指标仅能提供对其对学术用途可靠性的有限见解。我们将专用 OCR 转换器(TrOCR)和通用视觉语言模型(Qwen)在线级历史英文文本上进行比较,使用长度加权准确率指标和以假设为导向的错误分析。虽然 Qwen 在 CER/WER 上取得更低的得分并对降质输入更具鲁棒性,但它表现出选择性的语言规范化和正字法标准化,这可能会默默地改变历史上有意义的形式。TrOCR 在保存正字法忠实性方面更为一致,但更容易发生级联错误传播。我们的发现表明,架构的归纳偏差以系统性方式塑造了 OCR 错误结构。具有相似整体准确率的模型在错误局部性、可检测性和下游学术风险方面可能有显著差异,强调了在历史数字化工作流程中进行面向架构的评估的必要性。

关键词

引用

@article{arxiv.2602.14524,
  title  = {Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model},
  author = {Ari Vesalainen and Eetu Mäkelä and Laura Ruotsalainen and Mikko Tolonen},
  journal= {arXiv preprint arXiv:2602.14524},
  year   = {2026}
}