中文

面向真实场景文档解析的逼真场景合成与文档感知训练

计算机视觉与模式识别 2026-04-21 v3

摘要

文档解析最近通过多模态大语言模型(MLLM)直接将文档图像映射到结构化输出方面取得了进展。传统的级联管线依赖精确的布局分析,往往在随意捕获或非标准条件下失败。虽然端到端方法缓解了这种依赖,但仍表现出重复、幻觉以及结构不一致的预测——主要由于缺乏大规模高质量的全页(文档级)端到端解析数据,以及缺乏结构感知的训练策略。为此,我们提出一种面向稳健端到端文档解析的数据训练联合设计框架。通过将布局模板与丰富的文档元素组合,构建大规模、结构多样的全页端到端监督数据,实现逼真场景合成策略;同时,引入文档感知训练配方,通过渐进学习和结构标记优化,增强结构保真度和解码稳定性。我们进一步构建Wild-OmniDocBench——一个来自真实世界捕获文档的基准,用于鲁棒性评估。集成到1B参数的MLLM中,我们的方法在扫描/数字文档以及真实世界捕获场景中实现了卓越的准确率和鲁棒性。所有模型、数据合成管道和基准将对外公开,以推动未来文档理解研究的进展。

关键词

引用

@article{arxiv.2603.23885,
  title  = {Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training},
  author = {Gengluo Li and Pengyuan Lyu and Chengquan Zhang and Huawen Shen and Liang Wu and Xingyu Wan and Gangyan Zeng and Han Hu and Can Ma and Yu Zhou},
  journal= {arXiv preprint arXiv:2603.23885},
  year   = {2026}
}