SARD:面向书籍风格文本识别的大规模合成阿拉伯语 OCR 数据集
计算机视觉与模式识别
2025-06-02 v1
摘要
阿拉伯语光学字符识别(OCR)对于将海量阿拉伯语印刷媒体转换为数字格式至关重要。然而,训练现代 OCR 模型,尤其是强大的视觉-语言模型,受制于缺乏能够模拟真实世界书籍布局的大规模、多样化且结构良好的数据集。现有的阿拉伯语 OCR 数据集通常只关注孤立的单词或行,或者在规模、印刷字体多样性或书籍中存在的结构复杂性方面存在局限。为了填补这一显著空白,我们引入了 SARD(大规模合成阿拉伯语 OCR 数据集)。SARD 是一个专门设计用于模拟书籍风格文档的海量合成数据集。它包含 843,622 张文档图像,涵盖 6.9 亿个单词,使用十种不同的阿拉伯语字体渲染,以确保广泛的印刷字体覆盖。与源自扫描文档的数据集不同,SARD 不含真实世界的噪声和畸变,为模型训练提供了干净且受控的环境。其合成特性提供了无与伦比的可扩展性,并允许对布局和内容变化进行精确控制。我们详细介绍了该数据集的构成和生成过程,并提供了多种 OCR 模型(包括传统方法和深度学习方法)的基准测试结果,突出了该数据集带来的挑战与机遇。SARD 可作为开发和评估能够处理多样化阿拉伯语书籍风格文本的鲁棒 OCR 和视觉-语言模型的宝贵资源。
引用
@article{arxiv.2505.24600,
title = {SARD: A Large-Scale Synthetic Arabic OCR Dataset for Book-Style Text Recognition},
author = {Omer Nacar and Yasser Al-Habashi and Serry Sibaee and Adel Ammar and Wadii Boulila},
journal= {arXiv preprint arXiv:2505.24600},
year = {2025}
}