KuroNet:基于深度学习的日本前现代崩字字符识别
计算机视觉与模式识别
2019-10-22 v1 机器学习
摘要
崩字(Kuzushiji)是一种草写体,自 8 世纪起在日本使用了逾千年。涉及文学、科学、数学乃至烹饪等多样主题的超 300 万册书籍得以保存。然而,随着 1900 年日本书写系统的变革,崩字未被纳入常规学校课程。因此,现今大多数日本母语者无法阅读仅 150 年前书写或印刷的书籍。博物馆与图书馆投入大量精力制作这些历史文献的数字副本,以防范火灾、地震与海啸。由此产生了包含数亿张历史文献照片的数据集,而仅少数特训专家能够释读。因此,利用机器学习自动识别这些历史文本并转写为现代日文字符备受关注。尽管如此,崩字识别中的若干挑战致使现有系统性能极差。为应对这些挑战,我们提出 KuroNet,一种端到端新模型,其通过残差 U-Net 架构联合识别整页文本,在给定文本页下预测所有字符的位置与身份(无任何预处理)。这使模型能处理长程上下文、大词表与非标准化字符布局。我们展示了我们的系统能成功识别大部分前现代日本文献,同时也探讨了系统的局限并建议未来工作方向。
引用
@article{arxiv.1910.09433,
title = {KuroNet: Pre-Modern Japanese Kuzushiji Character Recognition with Deep Learning},
author = {Tarin Clanuwat and Alex Lamb and Asanobu Kitamoto},
journal= {arXiv preprint arXiv:1910.09433},
year = {2019}
}
备注
International Conference on Document Recognition (ICDAR) 2019 [oral]