中文

PaddleOCR 3.0 技术报告

计算机视觉与模式识别 2025-07-09 v1

摘要

本技术报告介绍了 PaddleOCR 3.0,这是一个采用 Apache 许可证的开源 OCR 和文档解析工具包。为响应大语言模型时代对文档理解日益增长的需求,PaddleOCR 3.0 提供了三大解决方案:(1)PP-OCRv5 用于多语言文本识别,(2)PP-StructureV3 用于层次化文档解析,(3)PP-ChatOCRv4 用于关键信息提取。与主流视觉语言模型(VLM)相比,这些参数不足 1 亿的模型在准确率和效率方面表现竞争力,甚至能够与数十亿参数的 VLM 相抗衡。除了提供高质量的 OCR 模型库,PaddleOCR 3.0 还提供高效的训练、推理和部署工具,支持异构硬件加速,使开发者能够轻松构建智能文档应用。

关键词

引用

@article{arxiv.2507.05595,
  title  = {PaddleOCR 3.0 Technical Report},
  author = {Cheng Cui and Ting Sun and Manhui Lin and Tingquan Gao and Yubo Zhang and Jiaxuan Liu and Xueqing Wang and Zelun Zhang and Changda Zhou and Hongen Liu and Yue Zhang and Wenyu Lv and Kui Huang and Yichao Zhang and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma},
  journal= {arXiv preprint arXiv:2507.05595},
  year   = {2025}
}