中文

MinerU2.5-Pro:推动以数据为中心的文档解析的极限

计算机视觉与模式识别 2026-04-10 v2 计算与语言

摘要

当前的文档解析方法主要通过模型架构创新推进,而训练数据的系统性工程仍被低估。然而,跨越多种架构和参数规模的最先进模型在同一组困难样本上表现出高度一致的失败模式,表明性能瓶颈源于训练数据中共有的缺陷而非架构差异。基于这一发现,我们提出了 MinerU2.5-Pro,仅通过数据工程和训练策略设计推进最先进水平,同时保持 MinerU2.5 的 1.2B 参数架构不变。其核心是一个围绕覆盖度、信息量和标注准确性协同设计的 Data Engine:多样性与难度感知采样将训练数据从不足 1000 万扩展到 6550 万样本,同时缓解分布偏移;跨模型一致性验证利用异构模型的输出共识来评估样本难度并生成可靠标注;评判与精炼流水线通过渲染-验证迭代修正提升困难样本的标注质量。三阶段渐进训练策略——大规模预训练、困难样本微调和 GRPO 对齐——在不同质量层级上依次利用这些数据。在评估方面,我们修正了 OmniDocBench v1.5 中的元素匹配偏差并引入了困难子集,建立了更具判别力的 OmniDocBench v1.6 协议。在不进行任何架构修改的情况下,MinerU2.5-Pro 在 OmniDocBench v1.6 上达到 95.69,比同架构基线提升 2.71 分,并超越了所有现有方法,包括基于参数多出 200 倍以上的模型的方法。

关键词

引用

@article{arxiv.2604.04771,
  title  = {MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale},
  author = {Bin Wang and Tianyao He and Linke Ouyang and Fan Wu and Zhiyuan Zhao and Tao Chu and Yuan Qu and Zhenjiang Jin and Weijun Zeng and Ziyang Miao and Bangrui Xu and Junbo Niu and Mengzhang Cai and Jiantao Qiu and Qintong Zhang and Dongsheng Ma and Yuefeng Sun and Hejun Dong and Wenzheng Zhang and Jutao Xiao and Jiayong Shi and Pengyu Liao and Xiaomeng Zhao and Huaping Zhong and Liqun Wei and Jing Yu and Jie Yang and Wei Li and Shasha Wang and Qianqian Wu and Xuanhe Zhou and Weijia Li and Zhenxiang Li and Zhongying Tu and Jiang Wu and Lijun Wu and Chao Xu and Kai Chen and Wentao Zhang and Yu Qiao and Bowen Zhou and Dahua Lin and Conghui He},
  journal= {arXiv preprint arXiv:2604.04771},
  year   = {2026}
}

备注

Technical Report