使用一维 BLSTM 分类器的手写乌尔都语字符识别
计算机视觉与模式识别
2017-05-17 v1
摘要
由于表示形式的多样性,草体文字的识别在光学字符识别(OCR)中被视为一项微妙的任务。每种草体文字具有不同的性质和相关挑战。由于乌尔都语是源自阿拉伯字母的草体语言,因此它几乎面临相同的挑战,甚至更加困难。我们可以根据所使用的文字对乌尔都语和阿拉伯语进行分类。乌尔都语大多以 Nastaliq 风格书写,而阿拉伯语遵循 Naskh 书写风格。本文提出了一个新颖且全面的乌尔都语手写离线数据库,名为 Urdu-Nastaliq Handwritten Dataset (UNHD)。目前,尚无公开的标准且全面的乌尔都语手写数据集可供研究者使用。所获取的数据集涵盖了由 500 名书写者以自然手写方式写在 A4 纸上的常用连字。我们使用循环神经网络进行了实验,并报告了手写乌尔都语字符识别的显著准确率。
引用
@article{arxiv.1705.05455,
title = {Handwritten Urdu Character Recognition using 1-Dimensional BLSTM Classifier},
author = {Saad Bin Ahmed and Saeeda Naz and Salahuddin Swati and Muhammad Imran Razzak},
journal= {arXiv preprint arXiv:1705.05455},
year = {2017}
}
备注
10 pages, Accepted in NCA for publication