中文

面向开箱即用识别与微调的历史拉丁文混合模型 OCR 训练

计算机视觉与模式识别 2021-06-16 v1

摘要

为将光学字符识别(Optical Character Recognition, OCR)全自动地应用于历史拉丁文印刷品,我们报告了构建一种广泛适用的多字体识别模型的努力,该模型在开箱即用时可产生字符错误率(Character Error Rate, CER)约 2% 的文本。此外,我们展示了如何以较少的人工与计算代价将该模型进一步微调至特定类别的印刷品。该混合或多字体模型在年代(15 至 19 世纪)、字体(各类 Fraktur 与 Antiqua)及语言(含德语、拉丁语、法语等)方面于广泛材料上训练。为优化结果,我们结合了 OCR 训练中既有技术如预训练、数据增强与投票。此外,我们使用多种预处理方法丰富训练数据并获得更鲁棒的模型。我们还实现了两阶段方法:先在所有可用的、显著不平衡的数据上训练,再通过在一精选的更平衡子集上训练来精炼输出。在 29 本此前未见书籍上的评估取得了 1.73% 的 CER,以近 40% 的优势优于 CER 为 2.84% 的广泛使用标准模型。从我们的混合模型出发为若干未见早期现代拉丁文书籍训练更专门的模型,得到 1.47% 的 CER,相较从头训练提升最高达 50%,相较从上述标准模型训练提升最高达 30%。我们的新混合模型已向社区公开。

关键词

引用

@article{arxiv.2106.07881,
  title  = {Mixed Model OCR Training on Historical Latin Script for Out-of-the-Box Recognition and Finetuning},
  author = {Christian Reul and Christoph Wick and Maximilian Nöth and Andreas Büttner and Maximilian Wehner and Uwe Springmann},
  journal= {arXiv preprint arXiv:2106.07881},
  year   = {2021}
}

备注

submitted to HIP'21