中文

TMIXT:一种转录混合手写与印刷文本的流程

机器学习 2019-04-30 v1 计算机视觉与模式识别 信息检索

摘要

在许多领域中,处理大量文档具有重要意义,在犯罪调查与国防领域尤为如此,其中组织可能需要在有限时间内处理大量扫描文档。然而,这一问题因扫描文档的数量以及待处理页面的复杂性而加剧。页面通常包含许多不同元素,各自需要被处理与理解。文本识别作为该过程的主要任务,通常依赖于文本类型,即手写或印刷。因此,识别需要在决定所采用的识别方法之前对文本类别进行预先分类。若文档同时包含手写与印刷文本,则任务更具挑战性。在本工作中,我们提出了一种通用流程,用于识别含混合手写与印刷文本的扫描文档中的文本,且无需预先分类文本。我们使用若干开源图像处理与文本识别包实现了所提出的流程。评估使用本工作中提出的 IAM 手写数据库的一个特别变体进行,对于同时含印刷与手写文本的页面,我们达到了近 80% 的平均转录准确率。

关键词

引用

@article{arxiv.1904.12387,
  title  = {TMIXT: A process flow for Transcribing MIXed handwritten and machine-printed Text},
  author = {Fady Medhat and Mahnaz Mohammadi and Sardar Jaf and Chris G. Willcocks and Toby P. Breckon and Peter Matthews and Andrew Stephen McGough and Georgios Theodoropoulos and Boguslaw Obara},
  journal= {arXiv preprint arXiv:1904.12387},
  year   = {2019}
}

备注

big data, unstructured data, Optical Character Recognition (OCR), Handwritten Text Recognition (HTR), machine-printed text recognition, IAM handwriting database, TMIXT