中文

bbOCR:面向孟加拉语文档的开源多领域 OCR 流水线

计算机视觉与模式识别 2023-08-23 v2

摘要

尽管存在众多光学字符识别(OCR)工具,综合开源系统的缺乏阻碍了包括孟加拉语在内的多种低资源语言文档数字化的进展。低资源语言,尤其是那些采用字母音节文字系统的语言,缺乏用于各类文档 OCR 组件(如词级 OCR、文档版面提取与畸变校正)的大规模数据集;而这些组件在高资源语言中可作为独立模块获得。本文介绍 Bengali..AI-BRACU-OCR(bbOCR):一种开源可扩展文档 OCR 系统,能利用新颖的孟加拉语文本识别模型与两个新颖合成数据集,将孟加拉语文档重建为结构化可检索的数字化格式。我们给出细致的组件级与系统级评估:两者均使用新颖的多样化评估数据集与综合评估指标。我们的广泛评估表明,相较当前最先进的孟加拉语 OCR 系统,所提方案更优。源代码与数据集可在此获取:https://bengaliai.github.io/bbocr。

关键词

引用

@article{arxiv.2308.10647,
  title  = {bbOCR: An Open-source Multi-domain OCR Pipeline for Bengali Documents},
  author = {Imam Mohammad Zulkarnain and Shayekh Bin Islam and Md. Zami Al Zunaed Farabe and Md. Mehedi Hasan Shawon and Jawaril Munshad Abedin and Beig Rajibul Hasan and Marsia Haque and Istiak Shihab and Syed Mobassir and MD. Nazmuddoha Ansary and Asif Sushmit and Farig Sadeque},
  journal= {arXiv preprint arXiv:2308.10647},
  year   = {2023}
}