中文

面向孟加拉语手写词的端到端光学字符识别

计算机视觉与模式识别 2021-05-11 v1 信息检索

摘要

光学字符识别(OCR)是利用文档图像将模拟文档转换为数字形式的过程。目前,针对多种语言的手写体和印刷体文档,已存在许多商业和非商业的OCR系统。尽管如此,在孟加拉语词识别方面可用的工作极少。其中,大多数工作集中于印刷体孟加拉字符的OCR。本文介绍了一种面向孟加拉语的端到端OCR系统。所提出的架构实现了一种端到端策略,可从手写词图像中识别手写孟加拉语词。我们尝试了流行的卷积神经网络(CNN)架构,包括DenseNet、Xception、NASNet和MobileNet,以构建OCR架构。此外,我们尝试了两种不同的循环神经网络(RNN)方法:LSTM和GRU。我们使用BanglaWritting数据集评估所提出的架构,该数据集是一个经过同行评审的孟加拉语手写图像数据集。所提出的方法在使用DenseNet121模型与GRU循环层时达到了0.091的字符错误率和0.273的词错误率。

关键词

引用

@article{arxiv.2105.04020,
  title  = {End-to-End Optical Character Recognition for Bengali Handwritten Words},
  author = {Farisa Benta Safir and Abu Quwsar Ohi and M. F. Mridha and Muhammad Mostafa Monowar and Md. Abdul Hamid},
  journal= {arXiv preprint arXiv:2105.04020},
  year   = {2021}
}

备注

Accepted in "The 4th National Computing Colleges Conference"