通过结合预训练、投票与主动学习提升早期印刷书籍的 OCR 准确率
计算机视觉与模式识别
2018-03-01 v2
摘要
我们结合三种能显著提升在早期印刷书籍上训练的 OCR 模型准确率的方法:(1)预训练方法利用已训练的、基于多种字体(混合模型)的现有模型中所存储的信息,而非从零开始训练。(2)使用单一 OCR 引擎(OCRopus)在单组真值数据(行图像及其转录文本)上进行交叉折训练,产生一个委员会,其成员通过考虑前 N 个候选及其内在置信度值来投票选出最佳结果。(3)遵循最大分歧原则,我们选取投票者分歧最大的额外训练行,期望它们为后续训练提供最高信息增益(主动学习)。对六本早期印刷书籍的评估得出如下结果:从同一混合模型出发训练五个折时,预训练与投票的结合平均将字符准确率提升了 46%。当使用不同模型进行预训练时,该数字升至 53%,凸显了多样化投票者的重要性。引入主动学习后,在六本书中的三本上评估,所得结果平均又提升了 16%。总体而言,所提方法在仅以 60 行训练时平均错误率为 2.5%。使用 1,000 行的可观真值池时,错误率进一步平均降至低于 1%。
引用
@article{arxiv.1802.10038,
title = {Improving OCR Accuracy on Early Printed Books by combining Pretraining, Voting, and Active Learning},
author = {Christian Reul and Uwe Springmann and Christoph Wick and Frank Puppe},
journal= {arXiv preprint arXiv:1802.10038},
year = {2018}
}
备注
Submitted to JLCL Volume 33 (2018), Issue 1: Special Issue on Automatic Text and Layout Recognition