中文

基于 Transformer 的乌尔都语手写文本光学字符识别器

计算机视觉与模式识别 2022-06-10 v1 人工智能 信息检索 机器学习

摘要

提取手写文本是信息数字化并使其可用于大规模环境的最重要组成部分之一。手写光学字符识别器(OCR)是计算机视觉与自然语言处理计算中的一个研究问题,针对英语已做了大量工作,但遗憾的是,针对乌尔都语等低资源语言的工作极少。乌尔都语文字因其连写特性以及字符形状随相对位置变化而非常困难,因此有必要提出一种能够理解复杂特征并泛化至各类书写风格的模型。本工作中,我们提出了一种基于 transformer 的乌尔都语手写文本提取模型。由于 transformer 在自然语言理解任务中非常成功,我们进一步探索其以理解复杂的乌尔都语手写体。

关键词

引用

@article{arxiv.2206.04575,
  title  = {Transformer based Urdu Handwritten Text Optical Character Reader},
  author = {Mohammad Daniyal Shaiq and Musa Dildar Ahmed Cheema and Ali Kamal},
  journal= {arXiv preprint arXiv:2206.04575},
  year   = {2022}
}