中文

PP-OCRv5:在 OCR 任务中与十亿参数视觉语言模型相抗衡的专用 500 万参数模型

计算机视觉与模式识别 2026-03-26 v1

摘要

“OCR 2.0”和大规模视觉语言模型(VLMs)的出现为文本识别树立了新标准。然而,这些统一架构往往伴随着显著的计算需求、在复杂布局中精确定位文本的挑战,以及倾向于文本幻觉的风险。我们重新审视了模型规模是唯一通往高精度之路的普遍观念,提出 PP-OCRv5,这是一个经过精心优化的轻量级 OCR 系统,仅包含 500 万个参数。我们展示了 PP-OCRv5 在标准 OCR 基准测试中达到了与许多十亿参数 VLMs 相抗衡的性能,同时实现了更精确的局部化和更少的幻觉。成功的核心不在于架构扩张,而在于数据中心的深入调查。我们系统性地剖析了训练数据的作用,通过量化三个关键维度:数据难度、数据准确性和数据多样性。我们的大量实验表明,随着高质量、准确标注且数据多样性充足的训练数据量的增加,传统高效双阶段 OCR 流水线的性能上限远高于人们通常所假设的。这项工作为大模型时代轻量级专用模型的可行性提供了有说服力的证据,并为 OCR 数据策划提供了实用见解。源代码和模型已公开于 https://github.com/PaddlePaddle/PaddleOCR。

关键词

引用

@article{arxiv.2603.24373,
  title  = {PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks},
  author = {Cheng Cui and Yubo Zhang and Ting Sun and Xueqing Wang and Hongen Liu and Manhui Lin and Yue Zhang and Tingquan Gao and Changda Zhou and Jiaxuan Liu and Zelun Zhang and Jing Zhang and Jun Zhang and Yi Liu},
  journal= {arXiv preprint arXiv:2603.24373},
  year   = {2026}
}