中文

Qalam:面向阿拉伯语OCR和手写体识别的多模态大语言模型

计算机视觉与模式识别 2024-07-19 v1 人工智能 计算与语言

摘要

阿拉伯语光学字符识别(OCR)和手写体识别(HWR)因阿拉伯文字的书写特性和语境依赖性而面临独特挑战。本研究介绍了 Qalam,一个专为阿拉伯语OCR和HWR设计的新型基础模型,基于SwinV2编码器和RoBERTa解码器架构。我们的模型在现有方法上显著超越,HWR任务实现仅0.80%的词错误率(WER),OCR任务实现1.18%的错误率。我们在包括超过450万张阿拉伯手稿图像和由60k图像-文本对组成的合成数据集上进行训练。值得注意的是,Qalam对阿拉伯字母的 diacritics(字母标记)处理尤为出色,这是阿拉伯文字中的关键特征。此外,它还显示出对高分辨率输入的惊人处理能力,缓解了当前OCR系统常见的局限性。这些突破性进展凸显了 Qalam 作为阿拉伯文字识别领先解决方案的潜力,在准确率和效率方面实现了显著的跃进。

关键词

引用

@article{arxiv.2407.13559,
  title  = {Qalam : A Multimodal LLM for Arabic Optical Character and Handwriting Recognition},
  author = {Gagan Bhatia and El Moatez Billah Nagoudi and Fakhraddin Alwajih and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2407.13559},
  year   = {2024}
}