中文

Infinity Parser:用于扫描文档解析的布局感知强化学习

计算机视觉与模式识别 2025-10-22 v3 人工智能 计算与语言 机器学习

摘要

将扫描文档自动解析为结构丰富、机器可读的格式仍然是文档AI的关键瓶颈,因为传统的多阶段流水线存在误差传播且对多样化布局的适应性有限。我们引入了layoutRL,一个端到端强化学习框架,通过优化归一化编辑距离、段落计数准确率和阅读顺序保持的复合奖励,训练模型显式地具备布局感知能力。利用我们最新发布的数据集Infinity-Doc-55K(结合了55K高保真合成扫描文档解析数据与专家筛选的真实世界文档),我们在一个基于视觉语言模型的解析器(称为Infinity-Parser)中实例化了layoutRL。在OCR、表格和公式提取以及阅读顺序检测的英文和中文基准上进行评估,Infinity-Parser在准确性和结构保真度方面均达到了新的最先进性能,超越了专用流水线和通用视觉语言模型。我们将公开发布代码和数据集,以推动鲁棒文档理解的进展。

关键词

引用

@article{arxiv.2506.03197,
  title  = {Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing},
  author = {Baode Wang and Biao Wu and Weizhen Li and Meng Fang and Zuming Huang and Jun Huang and Haozhe Wang and Yanjie Liang and Ling Chen and Wei Chu and Yuan Qi},
  journal= {arXiv preprint arXiv:2506.03197},
  year   = {2025}
}

备注

16 pages, 12 figures