中文

PP-DocBee2:高效数据下的多模态文档理解改进基线

计算机视觉与模式识别 2025-06-26 v2 人工智能 计算与语言

摘要

本报告介绍 PP-DocBee2,这是 PP-DocBee 的一个高级版本,旨在增强多模态文档理解。基于大型多模态模型架构构建,PP-DocBee2 通过关键技术改进克服了其前身的局限性,包括增强的合成数据质量、改进的视觉特征融合策略以及优化的推理方法。这些改进在内部中文商业文档基准上实现了 11.4%11.4\% 的性能提升,将推理延迟降低至原版本的 27.0%27.0\%。本工作的关键创新是针对多模态文档任务的数据质量优化策略。我们运用大规模多模态预训练模型对数据进行评估,应用新颖的统计标准筛选异常值,确保训练数据的高质量。灵感来自对多模态模型中未被充分利用的中间特征的洞察,我们通过将 ViT 表示分解为多层并应用新颖的特征融合策略来增强其表征能力,以提高复杂推理。源码和预训练模型已发布于\href{https://github.com/PaddlePaddle/PaddleMIX}{https://github.com/PaddlePaddle/PaddleMIX}。

关键词

引用

@article{arxiv.2506.18023,
  title  = {PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding},
  author = {Kui Huang and Xinrong Chen and Wenyu Lv and Jincheng Liao and Guanzhong Wang and Yi Liu},
  journal= {arXiv preprint arXiv:2506.18023},
  year   = {2025}
}