中文

利用交叉折刀训练与投票提升早期印刷书籍的OCR准确率

计算机视觉与模式识别 2018-07-25 v1

摘要

本文提出了一种方法,可显著降低基于早期印刷书籍训练的OCRopus模型所得OCR文本的字符错误率。该方法结合了交叉折刀训练与基于置信度的投票。在将可用真值分配至不同子集后,执行多次训练过程,每次得到一个特定的OCR模型。这些模型生成的OCR文本随后通过投票确定最终输出,投票时考虑识别出的字符、其候选字符以及赋予每个字符的置信度值。在七本早期印刷书籍上的实验表明,所提方法优于标准方法,将错误量减少了50%乃至更多。

关键词

引用

@article{arxiv.1711.09670,
  title  = {Improving OCR Accuracy on Early Printed Books by utilizing Cross Fold Training and Voting},
  author = {Christian Reul and Uwe Springmann and Christoph Wick and Frank Puppe},
  journal= {arXiv preprint arXiv:1711.09670},
  year   = {2018}
}