通过增强现有光学字符识别引擎使早期库尔德语出版物可被处理
计算与语言
2024-04-10 v1
摘要
库尔德语图书馆拥有许多早期引入印刷设备至库尔德斯坦时印刷的历史出版物。拥有良好的光学字符识别 (OCR) 来帮助处理这些出版物并丰富库尔德语资源至关重要,因为库尔德语被视为一种低资源语言。当前的 OCR 系统无法从历史文档中提取文本,因为这些文档存在许多问题,包括破损、非常脆弱、留有大量印记,且通常使用非标准字体等。这是处理这些文档的巨大障碍,因为目前处理它们需要手动录入,非常耗时。在本研究中,我们采用了 Google 的开源 OCR 框架 Tesseract 5.0 版本,该框架已被用于提取多种语言的文本。目前没有公开数据集,我们通过从 Zheen 档案与研究中心收集 1950 年前印刷的历史文档开发了自己的数据集,最终得到了包含 1233 张带有逐行转录的文本行图像的数据集。随后,我们使用阿拉伯语模型作为基础模型,并利用该数据集对模型进行了训练。我们使用不同方法评估了我们的模型,Tesseract 内置评估器 lstmeval 显示字符错误率 (CER) 为 0.755%。此外,Ocreval 显示平均字符准确率为 84.02%。最后,我们开发了一个 Web 应用程序,为终端用户提供易于使用的界面,允许他们通过输入页面图像并提取文本与模型进行交互。拥有大规模数据集对于开发具有合理准确率的 OCR 系统至关重要,因为目前没有针对历史库尔德语文档的公开数据集;这给我们的工作带来了重大挑战。此外,字符与单词之间未对齐的空格是我们工作中的另一挑战。
引用
@article{arxiv.2404.06101,
title = {Making Old Kurdish Publications Processable by Augmenting Available Optical Character Recognition Engines},
author = {Blnd Yaseen and Hossein Hassani},
journal= {arXiv preprint arXiv:2404.06101},
year = {2024}
}
备注
30 pages, 21 figures, 2 tables