中文

历史印刷品 OCR 模型的自动质量评估与(半)自动改进

数字图书馆 2016-10-21 v2

摘要

历史印刷品良好的 OCR 结果依赖于以忠实转录作为真实标签训练出的识别模型的可用性,而真实标签既是一种稀缺资源,又非常耗时且难以生成。我们提出了一种策略,无需为每种历史字体单独训练模型,而是从在各种字体下的可用转录组合集上训练出的模型开始。这些混合模型在同期印刷品的测试集上取得了超过 90% 的字符准确率,且这些印刷品在训练数据中没有任何表示,这证明了通过从少数字体泛化到一段时期内使用的更大(相似)字体集合来克服排版障碍的可能性。随后,这些混合模型的输出被用作基线,通过全自动方法和仅需极少人工转录的半自动方法进一步改进。为了在缺乏任何真实标签的情况下评估训练过程中生成的一系列模型中每个模型的识别质量,我们引入了两个易于观察且与真实准确率高度相关的量。这两个量是平均字符置信度 C(由 OCR 引擎 OCRopus 给出)和平均词元词汇度 L(一种考虑历史拼写模式的 OCR 词元与现代词形之间的距离度量,可针对任何 OCR 引擎计算)。虽然全自动方法仅能将混合模型的结果提高 1-2 个百分点,但仅需 100-200 行人工校正的行就能产生好得多的 OCR 结果,字符错误率仅为百分之几。该过程最大限度地减少了真实标签的生成量,并且不依赖于特定排版模型的预先构建。

关键词

引用

@article{arxiv.1606.05157,
  title  = {Automatic quality evaluation and (semi-) automatic improvement of OCR models for historical printings},
  author = {U. Springmann and F. Fink and K. U. Schulz},
  journal= {arXiv preprint arXiv:1606.05157},
  year   = {2016}
}