中文

E-ARMOR:面向多语言光学字符识别的边缘案例评估与回顾

计算与语言 2025-09-05 v1 人工智能

摘要

光学字符识别 (OCR) 在多语言、噪声且多样化的真实世界图像中仍然是一个重要挑战。随着大型视觉-语言模型 (LVLMs) 的兴起,人们越来越关注其超越固定 OCR 流程的泛化和推理能力。在本工作中,我们引入了 Sprinklr-Edge-OCR,一个专为在资源受限环境下的边缘部署优化的新型 OCR 系统。我们对五种最先进的 LVLMs (InternVL、Qwen、GOT OCR、LLaMA、MiniCPM) 和两种传统 OCR 系统 (Sprinklr-Edge-OCR、SuryaOCR) 在一个专有的、双手标注的多语言 (54 种语言) 图像数据集上的大规模比较评估。我们的基准涵盖包括准确率、语义一致性、语言覆盖、计算效率 (延迟、内存、GPU 使用) 以及部署成本等多个指标。为更好地反映实际应用,我们还进行了边缘案例部署分析,在仅使用 CPU 的环境中评估模型性能。结果显示,Qwen 在最高精度 (0.54) 上取得优势,而 Sprinklr-Edge-OCR 在整体 F1 分数 (0.46) 上表现最佳,并在效率方面显著优于其他模型,平均处理图像快 35 倍 (平均 0.17 秒/张),成本不到其他模型的 0.01 倍 (每 1000 张图像仅 0.006 美元)。我们的发现表明,即便在大语言模型时代,针对边缘部署的最优 OCR 系统仍是传统系统,由于其低计算需求、低延迟和极高的可负性。

关键词

引用

@article{arxiv.2509.03615,
  title  = {E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition},
  author = {Aryan Gupta and Anupam Purwar},
  journal= {arXiv preprint arXiv:2509.03615},
  year   = {2025}
}

备注

Sprinklr OCR provides a fast and compute light way of performing OCR