少标注数据下的历史文档手写识别
计算机视觉与模式识别
2018-11-20 v1 机器学习
机器学习
摘要
历史文档给离线手写识别系统带来诸多挑战,其中包括分割与标注步骤。训练 HTR 系统需要精细标注的文本行。在某些场景中,转录文本仅在段落级别可用,而无文本行信息。本工作中,我们展示了如何用极少标注数据训练 HTR 系统。具体而言,我们仅使用数据集中 10% 的人工标注文本行数据训练深度卷积循环神经网络(CRNN)系统,并提出了一种覆盖其余数据的增量训练流程。通过用专门构建的多尺度数据扩充训练集,性能进一步提升。我们还提出了一种基于模型的归一化方案,在识别阶段考虑书写尺度的变异性。我们将该方法应用于公开可用的 READ 数据集。我们的系统在 ICDAR2017 竞赛中取得了第二佳成绩。
引用
@article{arxiv.1811.07768,
title = {Handwriting Recognition of Historical Documents with few labeled data},
author = {Edgard Chammas and Chafic Mokbel and Laurence Likforman-Sulem},
journal= {arXiv preprint arXiv:1811.07768},
year = {2018}
}