中文

尼泊尔语和孟加拉语的光学文本识别:一种基于Transformer的方法

计算与语言 2024-04-04 v1

摘要

针对低资源语言的光学字符识别(OCR)系统的研发工作相对较新。低资源语言可用于训练机器翻译系统或其他系统的训练数据很少。尽管大量文本已被数字化并在互联网上提供,但这些文本仍以PDF和图像格式存在,无法直接访问。本文讨论了两种文字——孟加拉语和尼泊尔语的文本识别;孟加拉语和尼泊尔语的使用者分别约有3亿和4000万。在本研究中,使用编码器-解码器Transformer开发了一个模型,并通过一组光学文本图像(包括手写和印刷)评估了其有效性。结果表明,所提出的技术与当前方法相符,并在识别孟加拉语和尼泊尔语文本方面达到了高精度。这项研究可为东南亚语言学的高级和可访问研究铺平道路。

关键词

引用

@article{arxiv.2404.02375,
  title  = {Optical Text Recognition in Nepali and Bengali: A Transformer-based Approach},
  author = {S M Rakib Hasan and Aakar Dhakal and Md Humaion Kabir Mehedi and Annajiat Alim Rasel},
  journal= {arXiv preprint arXiv:2404.02375},
  year   = {2024}
}

备注

Accepted and Presented at ICAECC 2023, Bengaluru, India