中文

开源阿拉伯文字符 OCR 的进展与局限:一项案例研究

计算与语言 2024-02-20 v1 计算机视觉与模式识别

摘要

本文对开源 OCR 引擎 Kraken 在领先的阿拉伯语学术期刊《al-Abhath》上的准确性进行了研究。与其他商业可用的 OCR 引擎相比,Kraken 被证明能够生成高精度的阿拉伯文字符 OCR。该研究还评估了特定字体模型与通用模型在 al-Abhath 数据上的相对准确性,并对“错误实例”及可能导致 OCR 误识别的上下文特征进行了微观分析。基于此分析,本文认为,通过 (1) 采用更系统化的训练数据生产方法,以及 (2) 开发关键技术组件,特别是多语言模型以及改进的行分割和版面分析,可以显著改善阿拉伯文字符 OCR。

关键词

引用

@article{arxiv.2402.10943,
  title  = {Advances and Limitations in Open Source Arabic-Script OCR: A Case Study},
  author = {Benjamin Kiessling and Gennady Kurin and Matthew Thomas Miller and Kader Smail},
  journal= {arXiv preprint arXiv:2402.10943},
  year   = {2024}
}