中文

基于文本行的手写文字系统识别

计算机视觉与模式识别 2020-09-17 v1 机器学习

摘要

在如印度这样使用 12 种不同官方文字的多语言国家,手写文字系统的自动识别有助于许多重要应用,例如多语言文档的自动转录、在网页/数字档案中搜索包含特定文字的文档,以及在多语言环境中选择特定文字的光学字符识别(OCR)系统。在本文中,我们提出一种在文本行级别从手写文档识别文字系统的鲁棒方法。该识别基于使用链码直方图(CCH)和离散傅里叶变换(DFT)提取的特征。所提方法在 800 个手写文本行上进行了实验,这些文本行以七种印度文字(即 Gujarati、Kannada、Malayalam、Oriya、Tamil、Telugu、Urdu)以及罗马文字书写,使用支持向量机(SVM)分类器获得了 95.14% 的平均识别率。

关键词

引用

@article{arxiv.2009.07433,
  title  = {Handwritten Script Identification from Text Lines},
  author = {Pawan Kumar Singh and Iman Chatterjee and Ram Sarkar and Mita Nasipuri},
  journal= {arXiv preprint arXiv:2009.07433},
  year   = {2020}
}

备注

12 pages, 4 figures, conference