中文

面向可部署的印度语言 OCR 模型

计算机视觉与模式识别 2024-12-19 v2 计算与语言

摘要

对词或行图像上文本的识别,无需子词分割,已成为印度语言文本识别研究与开发的主流。使用连接主义时序分类(CTC)对未分割序列建模是无分割 OCR 最常用的方法。本工作中,我们对多种使用 CTC 将神经网络输出中的逐步预测转写为 Unicode 序列的神经网络模型进行了全面实证研究。该研究针对 13 种印度语言,使用每语言约 1000 页的内部数据集。我们研究了以行为单位与以词为单位的识别选择,以及使用合成数据训练模型。我们将我们的模型与流行的公开可用 OCR 工具进行端到端文档图像识别比较。我们采用所提识别模型与现有文本分割工具的端到端流水线,在 13 种语言中的 8 种上优于这些公开 OCR 工具。我们还引入了一个名为 Mozhi 的新的公开数据集,用于印度语言的词与行识别。该数据集包含跨越 13 种印度语言的超过 120 万标注词图像(12 万文本行)。我们的代码、训练模型与 Mozhi 数据集将发布于 http://cvit.iiit.ac.in/research/projects/cvit-projects/

关键词

引用

@article{arxiv.2205.06740,
  title  = {Towards Deployable OCR models for Indic languages},
  author = {Minesh Mathew and Ajoy Mondal and CV Jawahar},
  journal= {arXiv preprint arXiv:2205.06740},
  year   = {2024}
}

备注

presented at ICPR 2024; https://link.springer.com/chapter/10.1007/978-3-031-78495-8_11