使用基于组合机器学习的方法提高 19 世纪历史文献的 OCR 质量
计算机视觉与模式识别
2024-01-17 v1 机器学习
摘要
本文应对 19 世纪历史研究的一个重大挑战。大量资料首次以数字形式可用,而提取技术却相对滞后。因此,我们研究了机器学习(ML)模型,以识别和提取一份高价值历史原始资料——《Schematismus》中的复杂数据结构。该资料记录了 1702 年至 1918 年间哈布斯堡王朝文官体系中某一层级以上的每一个人,并记录了两个世纪以来中央行政机构的形成过程。其复杂精细的结构以及庞大的规模,使得迄今为止无法基于此资料对后期哈布斯堡帝国的行政和社会结构进行任何更全面的分析。我们追求两个核心目标:首要目标是提高 OCR 质量,为此我们认为改进结构识别至关重要;在后续过程中,事实证明这也使得数据结构的提取成为可能。我们选择 Faster R-CNN 作为结构识别 ML 架构的基础。为了快速、经济地获得所需数量的训练数据,我们合成了《Hof- und Staatsschematismus》风格的数据,并用其训练模型。然后,使用少量手动标注的历史原始数据对该模型进行微调。随后,我们使用针对我们文献风格进一步优化的 Tesseract-OCR,完成了组合结构提取和 OCR 过程。结果显示,OCR 性能的两个标准参数——WER 和 CER(值越低越好)显著下降。组合结构检测和微调后的 OCR 使 CER 和 WER 值分别显著提高了 71.98%(CER)和 52.49%(WER)。
引用
@article{arxiv.2401.07787,
title = {Improving OCR Quality in 19th Century Historical Documents Using a Combined Machine Learning Based Approach},
author = {David Fleischhacker and Wolfgang Goederle and Roman Kern},
journal= {arXiv preprint arXiv:2401.07787},
year = {2024}
}
备注
29 pages, 23 figures, 7 tables