基于混合模型与文档特定微调的中世纪手稿开源手写文本识别
计算机视觉与模式识别
2022-01-20 v1
摘要
本文处理德语中世纪手稿上实用且开源的手写文本识别(HTR)任务。我们报告了构建混合识别模型的努力,这些模型可开箱即用而无需任何进一步的文档特定训练,但也作为通过在几页转录文本(真值)上训练新模型进行微调的起点。为训练混合模型,我们收集了35部手稿及约12.5k文本行的语料库,涵盖两种广泛使用的书写风格:哥特体和bastarda草体。在四部未见过手稿上对混合模型开箱即用评估,得到平均字符错误率(CER)为6.22%。在训练2、4以及最终32页后,CER分别降至3.27%、2.58%和1.65%。虽然域内识别与模型训练(bastarda模型对bastarda材料,哥特体对哥特体)不出所料产生最佳结果,但将域外模型微调至未见脚本仍被证明优于从头训练。我们的新混合模型已向社区开源提供。
引用
@article{arxiv.2201.07661,
title = {Open Source Handwritten Text Recognition on Medieval Manuscripts using Mixed Models and Document-Specific Finetuning},
author = {Christian Reul and Stefan Tomasek and Florian Langhanki and Uwe Springmann},
journal= {arXiv preprint arXiv:2201.07661},
year = {2022}
}