中文

Cross-Lingual SynthDocs:面向阿拉伯语OCR与文档理解的大规模合成语料库

计算与语言 2025-11-10 v1 计算机视觉与模式识别

摘要

Cross-Lingual SynthDocs是一个大规模合成语料库,旨在解决阿拉伯语资源在光学字符识别(OCR)和文档理解(DU)方面的匮乏问题。该数据集包含超过250万个样本,包括150万个文本数据、27万个完全标注的表格以及数十万基于真实数据的图表。我们的管道利用真实扫描背景、双语布局和受 diacritic 约束的字体,捕捉阿拉伯文档的排版和结构复杂性。除了文本,该语料库还包括多种图表和表格的渲染样式。对SynthDocs进行微调的Qwen-2.5-VL模型在多个公开阿拉伯语基准测试中,在字词错误率(WER)和字符错误率(CER)方面实现了持续的改进,同时在其他模态中,Tree-Edit Distance Similarity(TEDS)和Chart Extraction Score(CharTeX)也取得了改善。SynthDocs为多语言文档分析的研究提供了一个可扩展、视觉上逼真的资源。

关键词

引用

@article{arxiv.2511.04699,
  title  = {Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding},
  author = {Haneen Al-Homoud and Asma Ibrahim and Murtadha Al-Jubran and Fahad Al-Otaibi and Yazeed Al-Harbi and Daulet Toibazar and Kesen Wang and Pedro J. Moreno},
  journal= {arXiv preprint arXiv:2511.04699},
  year   = {2025}
}