中文

MinerU-Popo:结构化文档解析的通用后处理模型

计算机视觉与模式识别 2026-05-26 v1 人工智能 计算与语言

摘要

基于视觉语言模型(VLM)的OCR模型已成为文档解析的事实标准,因其能够准确提取页面级元素(如单个页面内的段落)及其边界框和文本内容。然而,下游应用如检索增强生成(RAG)需要连贯的文档级信息,而这些模型常在跨页面连续性方面出错,难以恢复因页面边界被截断而中断的结构,如被截断的段落和表格。此类关系不局限于单一页面,而需要跨多页面对标题、段落、表格和图像进行联合分析。因此,自然的解决方案是重用现有OCR输出,通过后处理重建文档级逻辑结构。为此,我们提出MinerU-Popo,这是一个轻量且通用的OCR输出后处理框架,将来自不同解析器的页面级结果转换为连贯的文档级结构。MinerU-Popo将问题分解为四个专注子任务:文本截断恢复、表格截断恢复、标题层次重建和图像文本关联。为有效解决这些问题,我们构建了任务导向的数据引擎,采用任务特定的输入过滤,并使用生成的数据(30K)微调一个轻量级后处理模型(Qwen3-VL-4B)。为支持长文档,我们引入基于重叠的动态分块机制,对齐精炼模型的分块级输出并保持全局一致性。最后,我们将对齐后的输出组装成树状文档表示,并通过节点分块和摘要进一步丰富,以支持下游检索和分析。实证结果表明,MinerU-Popo在所有五个测试OCR模型上的标题层次TEDS提升至少20%,改善了RAG准确率并降低了每个查询的延迟。

关键词

引用

@article{arxiv.2605.24973,
  title  = {MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing},
  author = {Bangrui Xu and Ziyang Miao and Xuanhe Zhou and Yiming Lin and Zirui Tang and Xiaomeng Zhao and Fan Wu and Cheng Tan and Fan Wu and Bin Wang and Conghui He},
  journal= {arXiv preprint arXiv:2605.24973},
  year   = {2026}
}

备注

The code is available at https://github.com/opendatalab/MinerU-Popo