中文

面向早期印刷书籍的 OCRopus 模型训练的迁移学习

计算机视觉与模式识别 2017-12-22 v2

摘要

本文提出了一种方法,在仅有少量校勘转写文本可用时,能显著降低从早期印刷书籍上训练的 OCRopus 模型所获得的 OCR 文本的字符错误率。这是通过在训练时基于已有模型构建而非从零开始来实现的。为克服预训练模型的字符集与额外真值之间的不一致,对 OCRopus 代码进行了调整,以允许字母表扩展或缩减。该字符集现在能够在加载已有模型时,从预训练字母表中灵活地添加和删除字符。我们的实验使用了在早期拉丁文印刷品上自训练的混合模型,以及基于现代英文和德文 Fraktur 文本的两个标准 OCRopus 模型。在七本早期印刷书籍上的评估表明,与分别从零开始使用 60 和 150 行真值进行训练相比,从拉丁混合模型训练分别减少了 43% 和 26% 的平均错误量。此外,研究表明,即便基于与新加入的训练和测试数据无关的混合模型进行构建,也能带来显著改善的识别结果。

关键词

引用

@article{arxiv.1712.05586,
  title  = {Transfer Learning for OCRopus Model Training on Early Printed Books},
  author = {Christian Reul and Christoph Wick and Uwe Springmann and Frank Puppe},
  journal= {arXiv preprint arXiv:1712.05586},
  year   = {2017}
}