中文

为印度设计生产规模 OCR:多语言和领域特定系统

计算机视觉与模式识别 2026-02-19 v1 人工智能

摘要

为印度设计光学字符识别 (OCR) 系统需要在语言多样性、文档异质性和部署约束之间进行权衡。本文研究了通过 Chitrapathak 系列构建多语言 OCR 系统的两种训练策略。我们首先遵循一种流行的多模态方法,将通用视觉编码器与强大的多语言语言模型配对,并对 OCR 进行端到端训练。或者,我们探索对现有 OCR 模型进行微调,尽管该模型未针对目标语言进行训练。通过在多语言印地语 OCR 基准测试和部署导向指标上的广泛评估,我们发现第二种策略在准确率-延迟权衡方面始终优于第一种策略。Chitrapathak-2 在 Telugu (6.69 char ANLS) 中实现了 3-6 倍的加速,同时保持最先进 (SOTA) 水平,其余项目均排名第二。此外,我们提出 Parichay,一个独立的 OCR 模型系列,专为 9 个印度政府文件中提取结构化关键字段而设计,实现了 89.8% 的精确匹配得分,并具备更快的推理速度。这些系统实现了 SOTA 水平,为在印度语境下构建生产规模 OCR 管道提供了实用指导。

关键词

引用

@article{arxiv.2602.16430,
  title  = {Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems},
  author = {Ali Faraz and Raja Kolla and Ashish Kulkarni and Shubham Agarwal},
  journal= {arXiv preprint arXiv:2602.16430},
  year   = {2026}
}