Baseer:面向阿拉伯文档OCR的视觉语言模型
计算机视觉与模式识别
2025-09-26 v1 计算与语言
摘要
阿拉伯文档OCR仍是一个具有挑战性的任务,由于该语言的手写体脚本、多样化的字体、diacritic符号以及从右到左的书写方向。虽然现代多模态大语言模型(MLLM)已为高资源语言的文件理解做出了进展,但其在阿拉伯语方面的性能仍有限。本文介绍了Baseer,一款专为阿拉伯文档OCR进行微调的视觉语言模型。Baseer利用融合了合成文档和真实文档的大规模数据集进行训练,采用仅解码器的微调策略以适配预训练的MLLM,同时保留通用的视觉特征。我们还 presented了Misraj-DocOCR——一个高质量、经专家验证的基准,旨在严格评估阿拉伯OCR系统。我们的实验表明,Baseer显著优于现有的开源和商业解决方案,实现了0.25的字词错误率(WER),在阿拉伯文档OCR领域树立了新的最先进水平。我们的结果表明,针对通用目的MLLM进行领域特定适应的优势,为像阿拉伯语这样的屈折语言的高精度OCR提供了强大的基线。
引用
@article{arxiv.2509.18174,
title = {Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR},
author = {Khalil Hennara and Muhammad Hreden and Mohamed Motasim Hamed and Ahmad Bastati and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
journal= {arXiv preprint arXiv:2509.18174},
year = {2025}
}