中文

使用一维 BLSTM 分类器的手写乌尔都语字符识别

计算机视觉与模式识别 2017-05-17 v1

摘要

由于表示形式的多样性,草体文字的识别在光学字符识别(OCR)中被视为一项微妙的任务。每种草体文字具有不同的性质和相关挑战。由于乌尔都语是源自阿拉伯字母的草体语言,因此它几乎面临相同的挑战,甚至更加困难。我们可以根据所使用的文字对乌尔都语和阿拉伯语进行分类。乌尔都语大多以 Nastaliq 风格书写,而阿拉伯语遵循 Naskh 书写风格。本文提出了一个新颖且全面的乌尔都语手写离线数据库,名为 Urdu-Nastaliq Handwritten Dataset (UNHD)。目前,尚无公开的标准且全面的乌尔都语手写数据集可供研究者使用。所获取的数据集涵盖了由 500 名书写者以自然手写方式写在 A4 纸上的常用连字。我们使用循环神经网络进行了实验,并报告了手写乌尔都语字符识别的显著准确率。

关键词

引用

@article{arxiv.1705.05455,
  title  = {Handwritten Urdu Character Recognition using 1-Dimensional BLSTM Classifier},
  author = {Saad Bin Ahmed and Saeeda Naz and Salahuddin Swati and Muhammad Imran Razzak},
  journal= {arXiv preprint arXiv:1705.05455},
  year   = {2017}
}

备注

10 pages, Accepted in NCA for publication