中文

大规模字体无关的乌尔都语文本识别系统

计算机视觉与模式识别 2020-05-15 v1

摘要

近年来,OCR 算法性能显著提升,主要得益于人工智能算法能力的增强。然而,这一进展在不同语言间分布并不均衡。乌尔都语是未受足够关注的语言之一,尤其在字体无关方面。目前尚无能够可靠识别图像与视频中跨多种字体的印刷乌尔都语文本的自动化系统。为弥补这一缺口,我们构建了 Qaida——一个包含 256 种字体和完整乌尔都语词典的大规模数据集,并开发了一个基于卷积神经网络(CNN)的分类模型,该模型识别乌尔都语连字的准确率达 84.2%。此外,我们证明该识别网络不仅能识别其训练所用字体中的文本,还能可靠识别未见(新)字体中的文本。为此,本文做出如下贡献:(i)引入一个基于大规模、多字体的印刷乌尔都语文本识别数据集;(ii)设计、训练并评估了一个基于 CNN 的乌尔都语文本识别模型;(iii)尝试增量学习方法以取得乌尔都语文本识别的 SOTA 结果。所有实验选择均通过详实的实证分析进行了充分验证。我们相信本研究可作为进一步提升字体无关乌尔都语 OCR 系统性能的基础。

关键词

引用

@article{arxiv.2005.06752,
  title  = {Large Scale Font Independent Urdu Text Recognition System},
  author = {Atique Ur Rehman and Sibt Ul Hussain},
  journal= {arXiv preprint arXiv:2005.06752},
  year   = {2020}
}