中文

面向历史希伯来文本 OCR 错误校正的神经网络训练优化

计算与语言 2023-08-01 v1 机器学习

摘要

过去几十年,书籍、报纸等纸质文档的大型档案已使用光学字符识别(OCR)进行数字化。该技术易出错,尤其对历史文档。为校正 OCR 错误,已提出基于自然语言分析与神经网络等机器学习技术的后处理算法。神经网络的缺点是需要大量手动标注数据用于训练,而这些数据往往不可得。本文提出一种创新方法,使用显著更少的手动创建数据来训练轻量级神经网络用于希伯来语 OCR 后校正。主要研究目标是开发一种自动生成语言与任务特定训练数据的方法,以改善神经网络在 OCR 后校正上的结果,并探究哪类数据集对历史文档的 OCR 后校正最有效。为此,使用多个数据集开展了一系列实验。评估语料基于 JPress 项目的希伯来语报纸。对历史 OCR 报纸进行分析以了解常见的语言与语料特定 OCR 错误。我们发现,使用所提方法训练网络比使用随机生成错误更有效。结果还表明,神经网络用于 OCR 后校正的性能强烈依赖于训练数据的体裁与领域。此外,用所提方法训练的神经网络优于其他最先进的 OCR 后校正神经网络与复杂拼写检查器。这些结果可能对许多数字人文项目具有实践意义。

关键词

引用

@article{arxiv.2307.16220,
  title  = {Optimizing the Neural Network Training for OCR Error Correction of Historical Hebrew Texts},
  author = {Omri Suissa and Avshalom Elmalech and Maayan Zhitomirsky-Geffet},
  journal= {arXiv preprint arXiv:2307.16220},
  year   = {2023}
}