基于文本行的手写文字系统识别
计算机视觉与模式识别
2020-09-17 v1 机器学习
摘要
在如印度这样使用 12 种不同官方文字的多语言国家,手写文字系统的自动识别有助于许多重要应用,例如多语言文档的自动转录、在网页/数字档案中搜索包含特定文字的文档,以及在多语言环境中选择特定文字的光学字符识别(OCR)系统。在本文中,我们提出一种在文本行级别从手写文档识别文字系统的鲁棒方法。该识别基于使用链码直方图(CCH)和离散傅里叶变换(DFT)提取的特征。所提方法在 800 个手写文本行上进行了实验,这些文本行以七种印度文字(即 Gujarati、Kannada、Malayalam、Oriya、Tamil、Telugu、Urdu)以及罗马文字书写,使用支持向量机(SVM)分类器获得了 95.14% 的平均识别率。
引用
@article{arxiv.2009.07433,
title = {Handwritten Script Identification from Text Lines},
author = {Pawan Kumar Singh and Iman Chatterjee and Ram Sarkar and Mita Nasipuri},
journal= {arXiv preprint arXiv:2009.07433},
year = {2020}
}
备注
12 pages, 4 figures, conference