中文

MonkeyOCR:基于结构-识别-关系三元范式的文件解析

计算机视觉与模式识别 2026-02-10 v2

摘要

我们介绍了MonkeyOCR,这是一个基于结构-识别-关系(SRR)三元范式推进文件解析的模型,显著提升了当前最佳水平。该设计简化了原本复杂的多工具管道,避免了使用巨型端到端模型处理整页面的低效问题。在SRR范式中,文件解析被抽象为三个基本问题——“它在哪里?”(结构)、“它是什么?”(识别)和“它如何组织?”(关系)——分别对应于结构检测、内容识别和关系预测。为支持该范式,我们构建了MonkeyDoc数据集,包含450万个双语实例,覆盖超过十种文档类型,旨在解决现有数据集仅聚焦单一任务、语言或文档类型的局限。基于SRR范式和MonkeyDoc,我们训练了一个30亿参数的文件基础模型。我们进一步识别了该模型中的参数冗余,提出了连续参数退化(CPD),使可构建从06亿到12亿参数的模型,运行更快且性能损失可接受。MonkeyOCR实现了最先进的性能,超越了包括Gemini 2.5-Pro在内的前后端方法。此外,该模型可在单个RTX 3090 GPU上高效部署。代码和模型将发布于https://github.com/Yuliang-Liu/MonkeyOCR。

关键词

引用

@article{arxiv.2506.05218,
  title  = {MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm},
  author = {Zhang Li and Yuliang Liu and Qiang Liu and Zhiyin Ma and Ziyang Zhang and Shuo Zhang and Biao Yang and Zidun Guo and Jiarui Zhang and Xinyu Wang and Xiang Bai},
  journal= {arXiv preprint arXiv:2506.05218},
  year   = {2026}
}