中文

600k-ks-ocr:面向 Kashmiri 脚本光学字符识别的大规模合成数据集

计算机视觉与模式识别 2026-01-06 v1 计算与语言

摘要

本技术报告提出了600K-KS-OCR数据集,这是一个包含约602,000个单词级分段图像的大规模合成语料库,旨用于训练和评估面向 Kashmiri 脚本的光学字符识别系统。该数据集解决了Kashmiri(一种濒危的 Dardic 语,使用修改后的波斯-阿拉伯书写系统的语言)资源匮乏的问题,约有700万人使用该语言。每个图像以256x64像素呈现,并提供多种格式的对应 ground-truth 转录,兼容CRNN、TrOCR和通用机器学习管道。数据生成方法包括三种传统Kashmiri字体、模拟真实文档退化的综合数据增强,以及多样化的背景纹理,以增强模型的鲁棒性。该数据集分布在十个分区存档中,总计约10.6 GB,采用CC-BY-4.0许可证发布,以促进低资源语言光学字符识别领域的研究。

关键词

引用

@article{arxiv.2601.01088,
  title  = {600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script},
  author = {Haq Nawaz Malik},
  journal= {arXiv preprint arXiv:2601.01088},
  year   = {2026}
}