Digital Peter:数据集、竞赛与手写识别方法
计算机视觉与模式识别
2021-08-31 v2 人工智能
机器学习
摘要
本文呈现彼得大帝手稿的一个新数据集,并描述一种将文档初始图像转换为行的分割流程。该新数据集可有助于研究者训练手写文本识别模型,并作为比较不同模型的基准。其包含 9 694 张图像以及与历史文档中行相对应的文本文件。基于所考虑的数据集举办了开放式机器学习竞赛 Digital Peter。文中描述了该竞赛的基线方案以及更先进的 handwritten text recognition(手写文本识别)方法。完整数据集与所有代码均公开可用。
引用
@article{arxiv.2103.09354,
title = {Digital Peter: Dataset, Competition and Handwriting Recognition Methods},
author = {Mark Potanin and Denis Dimitrov and Alex Shonenkov and Vladimir Bataev and Denis Karachev and Maxim Novopoltsev},
journal= {arXiv preprint arXiv:2103.09354},
year = {2021}
}
备注
17 pages, 7 figures, submitted to ICDAR 2021