中文

BN-DRISHTI:基于手写文本图像实例级分割的孟加拉语文档识别

计算机视觉与模式识别 2023-09-27 v1

摘要

由于书写的曲线特性带来的行与词分割的复杂性以及高质量数据集的缺乏,对于孟加拉语等部分使用最广的语言,手写识别仍然具有挑战性。本文通过引入一种最先进的方法(BN-DRISHTI)来解决分割问题,该方法将基于深度学习的对象检测框架(YOLO)与用于倾斜校正的霍夫变换和仿射变换相结合。然而,训练深度学习模型需要海量数据。因此,我们还提出了BN-HTRd数据集的扩展版本,包含786张整页手写孟加拉语文档图像、用于分割的行级与词级标注,以及用于词识别的相应真值。在我们数据集的测试部分上的评估取得了行分割F值99.97%和词分割98%的结果。为进行比对分析,我们使用了三个外部孟加拉语手写数据集,即BanglaWriting、WBSUBNdb_text和ICDAR 2013,我们的系统以显著优势超越它们,进一步证明了我们的方法在完全未见样本上的性能。

关键词

引用

@article{arxiv.2306.09351,
  title  = {BN-DRISHTI: Bangla Document Recognition through Instance-level Segmentation of Handwritten Text Images},
  author = {Sheikh Mohammad Jubaer and Nazifa Tabassum and Md. Ataur Rahman and Mohammad Khairul Islam},
  journal= {arXiv preprint arXiv:2306.09351},
  year   = {2023}
}

备注

Will be published under the Springer Springer Lecture Notes in Computer Science (LNCS) series, as part of ICDAR WML 2023