中文

Pioneer数据集及基于深度自编码器与卷积神经网络的乌尔都语手写字符自动识别

计算机视觉与模式识别 2019-12-18 v1 计算与语言 机器学习

摘要

乌尔都语手写数字与字符的自动识别是一项具有挑战性的任务。它在邮政地址读取、银行支票处理以及古老手写稿件的数字化与保存方面有着应用。尽管针对英文及世界上其他主要语言手写字符的自动识别已有大量工作,乌尔都语的相关研究却极为不足。本文有两个目标。首先,我们介绍一个乌尔都语手写数字与字符的先驱数据集,包含来自900多名个体的样本。其次,我们报告了使用深度自编码器网络和卷积神经网络实现的 handwritten 数字与字符自动识别结果。更具体地,我们使用两层和三层深度自编码器网络以及卷积神经网络,并从识别准确率方面评估这两个框架。所提出的深度自编码器框架可成功识别数字和字符,仅数字准确率为97%,仅字符为81%,数字与字符同时识别为82%。相比之下,卷积神经网络框架的准确率分别为:仅数字96.7%,仅字符86.5%,数字与字符同时82.7%。这些框架可作为未来乌尔都语手写文本研究的基线。

关键词

引用

@article{arxiv.1912.07943,
  title  = {Pioneer dataset and automatic recognition of Urdu handwritten characters using a deep autoencoder and convolutional neural network},
  author = {Hazrat Ali and Ahsan Ullah and Talha Iqbal and Shahid Khattak},
  journal= {arXiv preprint arXiv:1912.07943},
  year   = {2019}
}

备注

SN Applied Sciences, December 2019