中文

从报纸到像素:演化乌尔都克文本识别

计算机视觉与模式识别 2026-03-05 v3

摘要

本文对比分析了大型语言模型(LLM)与传统光学字符识别(OCR)系统在乌尔都克报纸上的表现,聚焦复杂多列布局、低分辨率扫描以及纳斯塔利克(Nastaliq)脚本的风格化变异等挑战。为处理这些挑战,我们对 YOLOv11x 模型进行微调,用于文章级和栏级文本块提取,并训练基于 SwinIR 的超分辨率模块提升图像质量,以改善下游文本识别准确率,平均提升 50%。我们进一步引入乌尔都克报纸基准(Urdu Newspaper Benchmark, UNB),一个包含 829 幅段落图像、共 9,982 句的手动标注数据集,用于乌尔都克 OCR。结合 UNB 与 OpenITI 语料库,我们系统比较了传统 CNN+RNN 基于 OCR 系统与现代 LLM,在其中详细分析插入、删除和替换错误,以及字符级混淆模式。我们发现 Gemini-2.5-Pro 在 UNB 上表现最佳(WER 0.133),而仅通过微调 500 份领域内样本即可使 GPT-4o 性能提升 6.13% 绝对值,表明 LLM 对低资源、形态学复杂脚本如乌尔都克具有良好的适应性。UNB 数据集与微调模型已公开于 https://github.com/sameearif/urdu-newspaper-benchmark。

关键词

引用

@article{arxiv.2505.13943,
  title  = {From Press to Pixels: Evolving Urdu Text Recognition},
  author = {Samee Arif and Sualeha Farid},
  journal= {arXiv preprint arXiv:2505.13943},
  year   = {2026}
}