中文

PDF-WuKong: 一种用于高效长PDF阅读的端到端稀疏采样多模态大模型

计算机视觉与模式识别 2026-04-28 v3 人工智能 计算与语言

摘要

多模态文档理解是一项处理和理解大量文本与视觉信息的具有挑战性的任务。大型语言模型(LLM)的最新进展显著提高了这项任务的性能。然而,现有方法通常专注于纯文本或有限数量的文档图像,难以处理包含交错文本和图像的长PDF文档,尤其是学术论文。在本文中,我们介绍了PDF-WuKong,这是一种多模态大语言模型(MLLM),旨在增强长PDF文档的多模态问答(QA)能力。PDF-WuKong 集成了一个稀疏采样器,该采样器同时对文本和图像表示进行操作,显著提高了MLLM的效率和能力。稀疏采样器选择与用户查询最相关的段落或图表。为了有效训练和评估我们的模型,我们构建了PaperPDF数据集,该数据集包含大量英文和中文学术论文。我们提出了多种策略来构建110万个高质量问答对及其相应的证据来源。实验结果表明,我们的方法在长多模态文档理解任务上优于其他模型,在F1分数上平均超过商业产品8.6%。我们的代码和数据集将在 https://github.com/yh-hust/PDF-Wukong 发布。

关键词

引用

@article{arxiv.2410.05970,
  title  = {PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling},
  author = {Xudong Xie and Hao Yan and Liang Yin and Yang Liu and Jing Ding and Minghui Liao and Yuliang Liu and Wei Chen and Xiang Bai},
  journal= {arXiv preprint arXiv:2410.05970},
  year   = {2026}
}

备注

Accepted by International Journal of Computer Vision (IJCV)