面向资源匮乏语言与字母表词典学手写文本的可扩展识别系统
计算与语言
2023-03-30 v1 计算机视觉与模式识别
摘要
本文讨论了一种破译大型历史词典手写索引卡收藏的方法。我们的研究提供了一个可行方案,能读取这些卡片并将其词目链接至可搜索的词典条目列表,针对一部名为《17至18世纪波兰语词典》的大型历史词典,其包含280万张索引卡。我们应用了一种定制手写文本识别(HTR)方案,包括(1)优化的检测模型;(2)用于破译手写内容的识别模型,设计为空间变换网络(STN)后接卷积神经网络(RCNN)与连接时序分类层(CTC),使用50万个不同长度的生成波兰语词合成集训练;(3)使用约束词束搜索(WBC)的后处理步骤:将预测与预先已知的词典条目列表进行匹配。我们的模型在词级别达到0.881的准确率,优于基础RCNN模型。在本研究中,我们制作了2万张手动标注的索引卡,可用于未来的基准测试与迁移学习HTR应用。
引用
@article{arxiv.2303.16256,
title = {Scalable handwritten text recognition system for lexicographic sources of under-resourced languages and alphabets},
author = {Jan Idziak and Artjoms Šeļa and Michał Woźniak and Albert Leśniak and Joanna Byszuk and Maciej Eder},
journal= {arXiv preprint arXiv:2303.16256},
year = {2023}
}