中文

MinerU2.5:用于高效高分辨率文档解析的解耦视觉-语言模型

计算机视觉与模式识别 2025-09-30 v2 计算与语言

摘要

我们介绍了MinerU2.5,一个具有12亿参数的文档解析视觉-语言模型,它在保持卓越计算效率的同时实现了SOTA的识别准确率。我们的方法采用由粗到细的两阶段解析策略,将全局布局分析与局部内容识别解耦。在第一阶段,模型对下采样图像进行高效的布局分析以识别结构元素,从而规避了处理高分辨率输入的计算开销。在第二阶段,在全局布局的引导下,对从原始图像中提取的原始分辨率裁剪块进行针对性的内容识别,保留了密集文本、复杂公式和表格中的细粒度细节。为了支持这一策略,我们开发了一个全面的数据引擎,为预训练和微调生成多样化的大规模训练语料库。最终,MinerU2.5展现出强大的文档解析能力,在多个基准测试上取得了SOTA性能,在各种识别任务中超越了通用模型和领域特定模型,同时保持了显著更低的计算开销。

关键词

引用

@article{arxiv.2509.22186,
  title  = {MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing},
  author = {Junbo Niu and Zheng Liu and Zhuangcheng Gu and Bin Wang and Linke Ouyang and Zhiyuan Zhao and Tao Chu and Tianyao He and Fan Wu and Qintong Zhang and Zhenjiang Jin and Guang Liang and Rui Zhang and Wenzheng Zhang and Yuan Qu and Zhifei Ren and Yuefeng Sun and Yuanhong Zheng and Dongsheng Ma and Zirui Tang and Boyu Niu and Ziyang Miao and Hejun Dong and Siyi Qian and Junyuan Zhang and Jingzhou Chen and Fangdong Wang and Xiaomeng Zhao and Liqun Wei and Wei Li and Shasha Wang and Ruiliang Xu and Yuanyuan Cao and Lu Chen and Qianqian Wu and Huaiyu Gu and Lindong Lu and Keming Wang and Dechen Lin and Guanlin Shen and Xuanhe Zhou and Linfeng Zhang and Yuhang Zang and Xiaoyi Dong and Jiaqi Wang and Bo Zhang and Lei Bai and Pei Chu and Weijia Li and Jiang Wu and Lijun Wu and Zhenxiang Li and Guangyu Wang and Zhongying Tu and Chao Xu and Kai Chen and Yu Qiao and Bowen Zhou and Dahua Lin and Wentao Zhang and Conghui He},
  journal= {arXiv preprint arXiv:2509.22186},
  year   = {2025}
}

备注

Technical Report; GitHub Repo: https://github.com/opendatalab/MinerU Hugging Face Model: https://huggingface.co/opendatalab/MinerU2.5-2509-1.2B Hugging Face Demo: https://huggingface.co/spaces/opendatalab/MinerU