KITAB-Bench:面向阿拉伯语 OCR 与文档理解的综合多域基准
计算机视觉与模式识别
2025-06-30 v2 人工智能
计算与语言
人机交互
机器学习
摘要
随着检索增强生成(RAG)在文档处理中的广泛采用,稳健的文本识别对于知识提取至关重要。虽然 OCR 为英文及其他语言提供了大规模数据集和成熟基准,但由于阿拉伯语的书写体系独特、从右到左的文本流动以及复杂的排版和书法特征,阿拉伯语 OCR 面临独有的挑战。我们提出 KITAB-Bench,一个全面的阿拉伯语 OCR 基准,填补了当前评估体系的空白。该基准涵盖 8,809 个样本,覆盖 9 大领域和 36 个子领域,包含多种文档类型,包括手写文本、结构化表格以及针对商业智能的 21 种图表类型的专门覆盖。我们的发现表明,现代视觉语言模型(如 GPT-4o、Gemini 和 Qwen)在字符错误率(CER)上平均超过传统 OCR 方法(如 EasyOCR、PaddleOCR 和 Surya)约 60%。此外,我们突出了当前阿拉伯语 OCR 模型的显著局限性,尤其是在 PDF 到 Markdown 转换中,最佳模型 Gemini-2.0-Flash 仅实现 65% 的准确率。这进一步凸显了在阿拉伯语文本识别中存在的挑战,包括复杂字体、数字识别错误、词语延伸以及表格结构检测等问题。这一工作建立了一个严格的评估框架,可推动阿拉伯文档分析方法的进步,缩小与英文 OCR 技术之间的性能差距。
引用
@article{arxiv.2502.14949,
title = {KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding},
author = {Ahmed Heakl and Abdullah Sohail and Mukul Ranjan and Rania Hossam and Ghazi Shazan Ahmad and Mohamed El-Geish and Omar Maher and Zhiqiang Shen and Fahad Khan and Salman Khan},
journal= {arXiv preprint arXiv:2502.14949},
year = {2025}
}
备注
17 pages, 5 figures, ACL 2025