日本历史文档中字符顺序的预测
计算与语言
2021-06-15 v1 数字图书馆
机器学习
摘要
日本是一个具有独特文化遗产的独特国家,这反映在其保存的数十亿份历史文档中。然而,1900 年日本书写系统的变革使这些文档对公众而言难以获取。一个主要研究项目一直是使这些历史文档可获取且可理解。越来越多的研究聚焦于字符识别任务以及字符在图像上的位置,但较少研究关注如何预测字符的先后顺序。这是因为古典日文的语序与现代日文非常不同。将字符排序为序列对于使文档文本易于阅读和检索十分重要。此外,它是对该数据进行任何自然语言处理(例如机器翻译、语言建模和词嵌入)的必要步骤。我们探索了几种用于预测字符先后顺序任务的方法:一种使用简单的手工规则,另一种使用带自适应阈值的手工规则,还有一种使用以教师强制训练的深层循环序列模型。我们提供了这些技术的定量与定性比较以及它们各自的权衡。我们性能最佳的系统的准确率为 98.65%,并且在我们数据集中 49% 的书籍上达到完美准确率,表明该技术能够很好地预测字符顺序以满足许多任务的需求。
引用
@article{arxiv.2106.06786,
title = {Predicting the Ordering of Characters in Japanese Historical Documents},
author = {Alex Lamb and Tarin Clanuwat and Siyu Han and Mikel Bober-Irizar and Asanobu Kitamoto},
journal= {arXiv preprint arXiv:2106.06786},
year = {2021}
}