中文

Qianfan-OCR:文档智能的统一端到端模型

计算机视觉与模式识别 2026-03-17 v1

摘要

我们提出 Qianfan-OCR,一个 4B 参数的端到端视觉语言模型,统一文档解析、布局分析与文档理解于单一架构。它实现从图像到 Markdown 的直接转换,支持包括表格提取、图表理解、文档问答与关键信息提取等多样化的提示驱动任务。为解决端到端 OCR 中缺乏显式布局分析的问题,我们提出 Layout-as-Thought 方法,通过触发特殊思考标记(think tokens)实现可选的思考阶段,生成结构化布局表示——包括边界框、元素类型及阅读顺序——在生成最终输出前恢复布局定位能力,同时提升复杂布局的准确率。Qianfan-OCR 在 OmniDocBench v1.5(93.12)和 OlmOCR Bench(79.8)上位居端到端模型首位,在 OCRBench、CCOCR、DocVQA 和 ChartQA 等基准上与规模相当的通用 VLMs 实现持平,并在公开的关键信息提取基准中取得最高平均得分,超越了 Gemini-3.1-Pro、Seed-2.0 和 Qwen3-VL-235B。该模型已通过百度 AI 云千帆平台公开访问。

关键词

引用

@article{arxiv.2603.13398,
  title  = {Qianfan-OCR: A Unified End-to-End Model for Document Intelligence},
  author = {Daxiang Dong and Mingming Zheng and Dong Xu and Chunhua Luo and Bairong Zhuang and Yuxuan Li and Ruoyun He and Haoran Wang and Wenyu Zhang and Wenbo Wang and Yicheng Wang and Xue Xiong and Ayong Zheng and Xiaoying Zuo and Ziwei Ou and Jingnan Gu and Quanhao Guo and Jianmin Wu and Dawei Yin and Dou Shen},
  journal= {arXiv preprint arXiv:2603.13398},
  year   = {2026}
}