中文

UTRNet:用于印刷文档中乌尔都语文本的高分辨率识别

计算机视觉与模式识别 2023-08-24 v3 人工智能 机器学习

摘要

本文中,我们提出一种新方法,利用高分辨率、多尺度语义特征提取来解决印刷乌尔都语文本识别的挑战。我们提出的 UTRNet 架构是一种混合 CNN-RNN 模型,在基准数据集上展现出最先进的性能。为解决先前工作的局限——难以泛化到乌尔都语字母的复杂性以及缺乏充足的标注真实世界数据,我们引入了 UTRSet-Real,一个包含超过 11,000 行的大规模标注真实世界数据集,以及 UTRSet-Synth,一个具有 20,000 行、与真实世界高度相似的合成数据集,并对现有 IIITH 数据集的 ground truth 进行了修正,使其成为更可靠的未来研究资源。我们还提供了 UrduDoc,一个用于扫描文档中乌尔都语文本行检测的基准数据集。此外,我们通过将 UTRNet 与文本检测模型集成,开发了一个用于印刷文档端到端乌尔都语 OCR 的在线工具。我们的工作不仅解决了乌尔都语 OCR 当前的局限,也为该领域的未来研究铺平了道路,并促进了乌尔都语 OCR 技术的持续进步。包含源代码、数据集、标注、训练模型与在线工具的项目页面可在 abdur75648.github.io/UTRNet 获取。

关键词

引用

@article{arxiv.2306.15782,
  title  = {UTRNet: High-Resolution Urdu Text Recognition In Printed Documents},
  author = {Abdur Rahman and Arjun Ghosh and Chetan Arora},
  journal= {arXiv preprint arXiv:2306.15782},
  year   = {2023}
}

备注

Accepted at The 17th International Conference on Document Analysis and Recognition (ICDAR 2023)