中文

面向历史时期优化的神经网络用于历史希伯来文 OCR 纠错

计算与语言 2023-08-01 v1 机器学习

摘要

过去几十年,书籍、报纸等纸质历史文档的大型档案已通过光学字符识别(OCR)技术数字化。遗憾的是,这一广泛应用的技术容易出错,尤其当 OCR 文档写于数百年前时。神经网络在解决包括 OCR 后校正在内的多种文本处理任务中取得巨大成功。将神经网络用于历史语料的主要劣势在于其所需的可充分学习的大规模训练数据集的缺乏,尤其是对于像希伯来语这样形态丰富的语言。此外,由于其独特特征,尚不清楚用于希伯来语 OCR 纠错的神经网络的最优结构与超参数(预定义参数)取值。进而,语言随体裁与时期演变,这些演变可能影响 OCR 后校正神经网络模型的准确性。为克服这些挑战,我们开发了一种新的多阶段方法,用于生成带 OCR 错误的人工训练数据集,并优化超参数以构建高效的希伯来语 OCR 后校正神经网络。

关键词

引用

@article{arxiv.2307.16213,
  title  = {Toward a Period-Specific Optimized Neural Network for OCR Error Correction of Historical Hebrew Texts},
  author = {Omri Suissa and Maayan Zhitomirsky-Geffet and Avshalom Elmalech},
  journal= {arXiv preprint arXiv:2307.16213},
  year   = {2023}
}