中文

QARI-OCR:通过多模态大语言模型适配实现高保真阿拉伯语文本识别

计算机视觉与模式识别 2025-06-04 v1 人工智能

摘要

阿拉伯文字固有的复杂性——其连写特性、变音符号(tashkeel)以及多样的排版,对光学字符识别(OCR)构成了持续挑战。我们提出了 Qari-OCR,一系列源自 Qwen2-VL-2B-Instruct 的视觉语言模型,通过在专门的合成数据集上进行迭代微调,逐步针对阿拉伯语进行了优化。我们的主打模型 QARI v0.2 创下了新的开源 SOTA 表现,在富含变音符号的文本上实现了 0.160 的词错误率(WER)、0.061 的字符错误率(CER)以及 0.737 的 BLEU 分数。Qari-OCR 展现了对 tashkeel、多样字体和文档版面的卓越处理能力,并在低分辨率图像上表现出色。进一步的探索(QARI v0.3)展示了在结构化文档理解和手写文本方面的强大潜力。本工作在阿拉伯语 OCR 的准确性和效率上取得了显著提升,并已发布所有模型和数据集以促进进一步研究。

关键词

引用

@article{arxiv.2506.02295,
  title  = {QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation},
  author = {Ahmed Wasfy and Omer Nacar and Abdelakreem Elkhateb and Mahmoud Reda and Omar Elshehy and Adel Ammar and Wadii Boulila},
  journal= {arXiv preprint arXiv:2506.02295},
  year   = {2025}
}