中文

低资源语言零样本 OCR 准确率:斯 恰利亚语与泰米尔语比较分析

计算与语言 2025-08-26 v2

摘要

针对拉丁字母及其衍生脚本的光学字符识别(OCR)问题,由于在英语及其他高资源语言(HRL)上的研究已相当成熟,问题基本被解决。然而,对于使用独特脚本的低资源语言(LRL),该问题仍悬而未决。本研究对比分析了六种不同 OCR 引擎在两种 LRL(斯 恰利亚语与泰米尔语)上的零样本性能。所选引擎包括商业与开源系统,以评估各类型的优势。对斯 恰利亚语与泰米尔语分别评估了 Cloud Vision API、Surya、Document AI 和 Tesseract,而 Subasa OCR 与 EasyOCR 因限制因素仅针对一种语言进行测试。通过五种度量技术严格评估,这些系统在字符级和词级上的准确率。根据结果,Surya 在斯 恃利亚语的所有指标中表现最佳,词错误率(WER)为 2.61%;而 Document AI 在泰米尔语的所有指标中卓越表现,字符错误率(CER)仅为 0.78%。本文还引入了一个新的合成泰米尔语 OCR 基准数据集。

关键词

引用

@article{arxiv.2507.18264,
  title  = {Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil},
  author = {Nevidu Jayatilleke and Nisansa de Silva},
  journal= {arXiv preprint arXiv:2507.18264},
  year   = {2025}
}

备注

11 pages, 4 figures, 1 table, Accepted paper at Recent Advances in Natural Language Processing (RANLP) 2025