IDPL-PFOD2:面向印刷波斯语光学字符识别的新大规模数据集
计算机视觉与模式识别
2023-12-05 v1 数据库
摘要
光学字符识别是一种将文档图像转换为可搜索和可编辑文本的技术,使其成为处理扫描文档的宝贵工具。尽管波斯语是亚洲一种重要且官方的语言,但开发识别波斯语印刷文本的高效方法的工作相对有限。这主要归因于该语言的独特特征,如连写形式、某些字母字符之间的相似性,以及大量变音符号和点位置的存在。另一方面,鉴于基于深度学习的架构为了有效性能需要大量训练样本,此类数据集的开发具有至关重要的意义。鉴于这些考虑,本文旨在提出一个新的大规模数据集 IDPL-PFOD2,专为波斯语印刷文本识别而定制。该数据集包含 2003541 张图像,具有多种字体、风格和尺寸。该数据集是先前引入的 IDPL-PFOD 数据集的扩展,在数量和多样性上都有大幅提升。此外,通过使用基于 CRNN 的架构和 Vision Transformer 架构评估了该数据集的有效性。基于 CRNN 的模型实现了 78.49% 的基线准确率和 97.72% 的归一化编辑距离,而 Vision Transformer 架构达到了 81.32% 的准确率和 98.74% 的归一化编辑距离。
引用
@article{arxiv.2312.01177,
title = {IDPL-PFOD2: A New Large-Scale Dataset for Printed Farsi Optical Character Recognition},
author = {Fatemeh Asadi-zeydabadi and Ali Afkari-Fahandari and Amin Faraji and Elham Shabaninia and Hossein Nezamabadi-pour},
journal= {arXiv preprint arXiv:2312.01177},
year = {2023}
}