孟加拉语印刷文本的文档分解
计算机视觉与模式识别
2017-01-31 v1 计算与语言
摘要
如今各类信息正被数字化,伴随所有这些数字化,大量各种文档档案也正被数字化。我们知道,光学字符识别是将报纸和其他纸质文档转换为数字资源的方法。但事实是,该方法仅对文本有效。因此,如果我们尝试处理任何包含非文本区域的文档,我们将得到乱码文本作为输出。这就是为什么为了正确数字化文档,它们应当被仔细预处理。而在预处理中,根据类别将文档分割为不同区域是最重要的。但是,现有的孟加拉语光学字符识别过程没有这样一种能够完全分类报纸/书籍页面的算法。因此我们致力于将文档分解为其若干部分,如标题、子标题、栏目、图像等。并且如果输入是倾斜和旋转的,则输入也被去倾斜和去旋转。为了分解任何孟加拉语文档,我们找出输入图像的边缘。然后我们找出每个像素所在的水平和垂直区域。随后根据这些数据切割输入图像。然后我们选取每个子图像并找出其高宽比、行高。然后根据这些值对子图像进行分类。为了去倾斜图像,我们找出倾斜角度并根据该角度去倾斜图像。为了去旋转图像,我们使用行高、matra线和matra线的像素比。
引用
@article{arxiv.1701.08706,
title = {Document Decomposition of Bangla Printed Text},
author = {Md. Fahad Hasan and Tasmin Afroz and Sabir Ismail and Md. Saiful Islam},
journal= {arXiv preprint arXiv:1701.08706},
year = {2017}
}
备注
6 pages