SynthOCR-Gen:面向低资源语言的合成 OCR 数据集生成器——打破数据壁垒
计算与语言
2026-01-23 v1 计算机视觉与模式识别
摘要
由于缺乏大规模标注训练数据集,低资源语言的光学字符识别(OCR)仍然是一个重大挑战。像克什米尔语这样拥有约 700 万使用者且使用具有独特变音符号的复杂波斯-阿拉伯文字的语言,目前在包括 Tesseract、TrOCR 和 PaddleOCR 在内的主流 OCR 系统中缺乏支持。为此类语言手动创建数据集成本高昂、耗时且容易出错,通常需要对印刷或手写文本进行逐字转录。我们推出了 SynthOCR-Gen,这是一个专为低资源语言设计的开源合成 OCR 数据集生成器。我们的工具通过将数字 Unicode 文本语料库转换为即用型训练数据集,解决了 OCR 开发中的根本瓶颈。该系统实现了一个全面的流水线,包括文本分割(字符、单词、n-gram、句子和行级别)、带有脚本纯净性强制执行的 Unicode 规范化、具有可配置分布的多字体渲染,以及超过 25 种模拟真实世界文档退化的数据增强技术,包括旋转、模糊、噪声和扫描仪伪影。我们通过生成一个包含 600,000 个样本的单词分割克什米尔语 OCR 数据集(已在 HuggingFace 上公开发布)来证明我们方法的有效性。这项工作为将低资源语言带入视觉-语言 AI 模型时代提供了一条实用途径,并且该工具面向全球从事服务不足书写系统研究的研究人员和从业者开放。
引用
@article{arxiv.2601.16113,
title = {synthocr-gen: A synthetic ocr dataset generator for low-resource languages- breaking the data barrier},
author = {Haq Nawaz Malik and Kh Mohmad Shafi and Tanveer Ahmad Reshi},
journal= {arXiv preprint arXiv:2601.16113},
year = {2026}
}