中文

阿拉伯-阿诺加:基于微调视觉 Transformer 的阿拉伯语 OCR 与 Markdown 提取

计算与语言 2024-11-28 v1 人工智能 计算机视觉与模式识别

摘要

我们提出 Arabic-Nougat,一套用于将阿拉伯书页转换为结构化 Markdown 文本的 OCR 模型。基于 Meta 的 Nougat 架构,Arabic-Nougat 包括三个专门模型:arabic-small-nougat、arabic-base-nougat 和 arabic-large-nougat。这些模型在由 13.7 万对阿拉伯书页及其 Markdown 表示组成的合成数据集 arabic-img2md 上进行微调。关键贡献包括为高效分词而设计的 Aranizer-PBE-86k 词汇表,以及使用 torch.bfloat16 精度和 Flash Attention 2 进行优化训练和推理。我们的模型实现了最先进的性能,其中 arabic-large-nougat 在 Markdown 结构准确率最高、字符错误率最低。此外,我们发布了一个大规模数据集,包含从超过 8500 本书中提取的 110 亿个阿拉伯语 token,为阿拉伯语 OCR 研究提供了宝贵资源。所有模型、数据集和代码均已开源并可在 https://github.com/MohamedAliRashad/arabic-nougat 上获取。

关键词

引用

@article{arxiv.2411.17835,
  title  = {Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction},
  author = {Mohamed Rashad},
  journal= {arXiv preprint arXiv:2411.17835},
  year   = {2024}
}

备注

7 pages, 1 figure