PaddleOCR-VL:通过 0.9B 超紧凑视觉语言模型提升多语言文档解析
计算机视觉与模式识别
2025-11-26 v4
摘要
本报告中,我们提出 PaddleOCR-VL,一个领先且资源高效的文档解析模型。其核心组件是 PaddleOCR-VL-0.9B,一个紧凑而强大的视觉语言模型(VLM),它集成了基于 NaViT 风格的动态分辨率视觉编码器和 ERNIE-4.5-0.3B 语言模型,以实现精准的元素识别。这种创新模型高效支持 109 种语言,在识别复杂元素(如文本、表格、公式和图表)方面表现出色,同时保持最小资源消耗。通过在广泛使用的公共基准和内部基准上的全面评估,PaddleOCR-VL 在页面级文档解析和元素级识别方面均实现领先性能。它显著优于现有解决方案,在与顶级 VLM 的竞争中表现出色,提供快速的推理速度。这些优势使其在实际场景中具有高度适用性。代码已公开于 https://github.com/PaddlePaddle/PaddleOCR。
关键词
引用
@article{arxiv.2510.14528,
title = {PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model},
author = {Cheng Cui and Ting Sun and Suyin Liang and Tingquan Gao and Zelun Zhang and Jiaxuan Liu and Xueqing Wang and Changda Zhou and Hongen Liu and Manhui Lin and Yue Zhang and Yubo Zhang and Handong Zheng and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma},
journal= {arXiv preprint arXiv:2510.14528},
year = {2025}
}
备注
Github Repo: https://github.com/PaddlePaddle/PaddleOCR