PsOCR:低资源普什图语光学字符识别中大型多模态模型的基准测试
计算机视觉与模式识别
2026-01-12 v2 人工智能
摘要
本文评估了大型多模态模型(LMM)在低资源普什图语光学字符识别(OCR)中的性能。普什图语的自然语言处理面临诸多挑战,包括其书写系统的连笔特性以及结构化数据集的匮乏。为解决这一问题,我们开发了合成普什图语 OCR 数据集 PsOCR,包含一百万张在词、行和文档级别标注边界框的图像,适用于基于不同架构(包括卷积神经网络 CNN 和 Transformer)模型的训练与评估。PsOCR 涵盖了 1000 种独特字体家族、颜色、图像尺寸和布局的变体。从中选取了 1 万张图像的基准子集,用于评估多个 LMM 的性能,包括七个开源模型:DeepSeek 的 Janus、InternVL、MiniCPM、Florence 以及 Qwen(3B 和 7B),以及四个闭源模型:GPT-4o、Gemini、Claude 和 Grok。实验结果表明,Gemini 在所有模型中表现最佳,而在开源模型中 Qwen-7B 脱颖而出。本工作为当前 LMM 在普什图语 OCR 任务中的能力与局限提供了深入评估,并为普什图语 OCR 以及阿拉伯语、波斯语和乌尔都语等其他类似书写系统的进一步研究奠定了基础。PsOCR 可在 https://github.com/zirak-ai/PashtoOCR 获取。
引用
@article{arxiv.2505.10055,
title = {PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language},
author = {Ijazul Haq and Yingjie Zhang and Irfan Ali Khan},
journal= {arXiv preprint arXiv:2505.10055},
year = {2026}
}