中文

历史手写文档的整页识别

计算机视觉与模式识别 2020-09-23 v1 人工智能

摘要

历史手写文档守护着人类知识的重要部分,却仅有少数学者与专家能够触及。机器学习与手写识别研究的最新进展,有潜力让更广泛受众获取并检索这些信息。为此,我们研究了一种无需文本定位的端到端推断方法,该方法接收手写页面并转写出其全部文本。推断过程不涉及显式的字符、单词或行分割,因此我们称此方法为“无分割(segmentation free)”。我们基于 IAM、RODRIGO 与 ScribbleLens 语料库,在跨越 400 年手写风格、三种语言下,探索其与逐行分割方法相比的鲁棒性与准确率。我们聚焦于可部署于手持或嵌入式设备的模型类型与规模。我们得出结论:无文本定位与分割的整页推断方法具有竞争力。

关键词

引用

@article{arxiv.2009.10634,
  title  = {Whole page recognition of historical handwriting},
  author = {Hans J. G. A. Dolfing},
  journal= {arXiv preprint arXiv:2009.10634},
  year   = {2020}
}

备注

6 pages