用于西里尔字母手写体OCR后校正的数据生成
计算机视觉与模式识别
2023-11-28 v1 计算与语言
摘要
本文提出了一种针对手写西里尔字母文本的OCR后校正(POC)新方法,弥补了当前研究方法的显著空白。这一空白源于缺乏提供OCR错误的大规模文本语料库,以进一步训练基于语言的POC模型,而此类模型对语料库规模要求很高。我们的研究主要关注基于Bézier曲线的合成手写生成引擎的开发与应用。该引擎能生成任意数量的高度逼真手写文本,我们利用它将来自互联网的俄文文本语料库转化为一个大规模数据集。我们将手写文本识别(HTR)模型应用于该数据集以识别OCR错误,作为我们POC模型训练的基础。校正模型在90字符输入上下文上训练,利用预训练的T5架构和seq2seq校正任务。我们在HWR200和School_notebooks_RU数据集上评估了我们的方法,因为它们在HTR领域提供了重大挑战。此外,POC可用于为教师高亮错误,评估学生表现。这只需通过比较校正前后的句子,显示文本差异即可实现。我们的主要贡献在于创新性地使用Bézier曲线生成西里尔字母文本,并利用专门的POC模型进行后续错误校正。我们通过展示词准确率(WAR)和字符准确率(CAR)结果来验证我们的方法,包括使用真实开放手写西里尔字母文本语料库进行有和无OCR后校正的情况。这些结果连同我们的方法均可复现,为该OCR和手写文本分析领域的进一步进展铺平道路。论文贡献见 https://github.com/dbrainio/CyrillicHandwritingPOC
引用
@article{arxiv.2311.15896,
title = {Data Generation for Post-OCR correction of Cyrillic handwriting},
author = {Evgenii Davydkin and Aleksandr Markelov and Egor Iuldashev and Anton Dudkin and Ivan Krivorotov},
journal= {arXiv preprint arXiv:2311.15896},
year = {2023}
}
备注
17 pages, 27 figures, 6 tables, 26 references