KazakhOCR:用于评估低资源哈萨克斯坦书写脚本OCR的合成基准
计算机视觉与模式识别
2026-03-17 v1 计算与语言
摘要
哈萨克语使用阿拉伯文、西里尔文和拉丁文书写系统,使其在光学字符识别(OCR)方面独特。针对低资源哈萨克斯坦书写脚本的OCR工作稀少,且阿拉伯文和拉丁文脚本不存在OCR基准或图像。我们构建了包含7,219张图片的合成OCR数据集,覆盖三种书写系统,包含字体、颜色和噪声变异,以模拟真实OCR任务。我们对三个多模态大语言模型(MLLMs)在OCR和语言识别子集上的表现进行评估:Gemma-3-12B-it、Qwen2.5-VL-7B-Instruct 和 Llama-3.2-11B-Vision-Instruct。所有模型在拉丁文和阿拉伯文脚本OCR中均不成功,且未能将阿拉伯文脚本识别为哈萨克斯坦语,误将其分类为阿拉伯语、菲斯基语和库尔德语。我们进一步比较MLLMs与经典OCR基线,发现虽然传统OCR的字符错误率更低,但MLLMs未能匹配此性能。这些发现表明当前MLLMs在处理低资源阿拉伯字母脚本方面存在显著不足,显示了支持低资源脚本和语言的包容性模型和基准的必要性。
引用
@article{arxiv.2603.13238,
title = {KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR},
author = {Henry Gagnier and Sophie Gagnier and Ashwin Kirubakaran},
journal= {arXiv preprint arXiv:2603.13238},
year = {2026}
}
备注
Accepted to AbjadNLP @ EACL 2026