BN-HTRd:面向文档级离线孟加拉语手写文本识别与行分割的基准数据集
计算机视觉与模式识别
2022-06-22 v1 计算与语言
摘要
我们引入了一个新的数据集,用于从包含单词、行和文档级标注的孟加拉语手写图像中进行离线手写文本识别(HTR)。BN-HTRd 数据集基于 BBC 孟加拉语新闻语料库,旨在充当真实文本。这些文本随后被用于生成由人们手写填写的标注。我们的数据集包含约 150 位不同书写者生成的 788 张手写页面图像。它可以作为各种手写分类任务的基础,例如端到端文档识别、单词定位、单词或行分割等。我们还提出了一种以无监督方式将孟加拉语手写文档图像分割为相应行的方法。我们的行分割方法考虑了不同书写风格中的可变性,能够准确分割曲线性质的复杂手写文本行。除了一系列预处理和形态学操作外,还采用了霍夫直线和圆变换来区分不同的线性分量。为了将这些分量排列到相应的行中,我们采用了一种无监督聚类方法。在 FM 指标(类似于 F-measure)方面,我们的分割技术的平均成功率为 81.57%,平均精度均值(mAP)为 0.547。
引用
@article{arxiv.2206.08977,
title = {BN-HTRd: A Benchmark Dataset for Document Level Offline Bangla Handwritten Text Recognition (HTR) and Line Segmentation},
author = {Md. Ataur Rahman and Nazifa Tabassum and Mitu Paul and Riya Pal and Mohammad Khairul Islam},
journal= {arXiv preprint arXiv:2206.08977},
year = {2022}
}