AtlasOCR:基于视觉语言模型构建的第一个开源达维亚 OCR 模型
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
达维亚(Darija)是摩洛哥阿拉伯方言,富含视觉内容,却缺乏专业的光学字符识别(OCR)工具。本文介绍AtlasOCR,这是第一个基于 30 亿参数视觉语言模型(VLM)微调而来的开源达维亚 OCR 模型。我们详细阐述了我们的全面方法,包括利用 OCRSmith 库进行合成生成和仔细来源化的真实世界数据的综合数据集构建,以及高效的微调策略。我们利用 QLoRA 和 Unsloth 对 Qwen2.5-VL 3B 进行参数高效训练,并对关键超参数进行全面消融研究。我们的评估在新构建的 AtlasOCRBench 和 established 的 KITAB-Bench 上显示出领先的性能,挑战了更大的模型,凸显了 AtlasOCR 在达维亚和标准阿拉伯文 OCR 任务中的鲁棒性和泛化能力。
引用
@article{arxiv.2604.08070,
title = {AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models},
author = {Imane Momayiz and Soufiane Ait Elaouad and Abdeljalil Elmajjodi and Haitame Bouanane},
journal= {arXiv preprint arXiv:2604.08070},
year = {2026}
}