中文

升级利用你的 OCR:在罗马化梵文中复用 OCR 进行 OCR 后文本校正

计算与语言 2018-09-10 v1

摘要

我们提出了一种用于罗马化梵文文本数字化的 OCR 后文本校正方法。由于缺乏资源,我们的方法使用了为其他以罗马字母书写的语言训练的 OCR 模型。目前尚无可用于罗马化梵文 OCR 的数据集。因此,我们引导构建了一个包含 430 张图像的数据集,这些图像在两种不同设置下扫描,并附有相应的真实标注。对于训练,我们为两种设置合成生成训练图像。我们发现,使用复制机制(Gu et al., 2016)相比当前解决单调序列到序列任务的最优模型(Schnober et al., 2016)在字符识别率(CRR)上带来了 7.69% 的提升。我们发现我们的系统能稳健地对抗易发生于 OCR 的错误,因为在其中一种数据集设置下,它从 CRR 为 35.76% 的 OCR 输出中获得了 87.01% 的 CRR。在模型上开展的人类判断调查显示,我们提出的模型所产生的预测,相比其他系统,人类理解更快、改进也更快。

关键词

引用

@article{arxiv.1809.02147,
  title  = {Upcycle Your OCR: Reusing OCRs for Post-OCR Text Correction in Romanised Sanskrit},
  author = {Amrith Krishna and Bodhisattwa Prasad Majumder and Rajesh Shreedhar Bhat and Pawan Goyal},
  journal= {arXiv preprint arXiv:1809.02147},
  year   = {2018}
}

备注

This paper has been accepted as a full paper in the SIGNLL Conference on Computational Natural Language Learning (CoNLL), 2018. The code, data and the supplementary material is available at https://github.com/majumderb/sanskrit-ocr