中文

VDocRAG:面向视觉富文档的检索增强生成

计算与语言 2025-04-15 v1 人工智能 计算机视觉与模式识别 信息检索

摘要

我们旨在开发一种检索增强生成(RAG)框架,用于回答关于以混合模态(如图表、表格)和多样化格式(如 PDF、PPTX)呈现的视觉富文档语料库的问题。在本文中,我们提出了一种新的 RAG 框架 VDocRAG,它能够以统一的图像格式直接理解各种文档和模态,从而避免通过解析文档获取文本时所造成的信息丢失。为了提升性能,我们提出了新颖的自监督预训练任务,通过将视觉信息压缩为稠密的 token 表示,同时使其与文档中的文本内容对齐,从而使大型视觉-语言模型适应检索任务。此外,我们引入了 OpenDocVQA,这是首个面向开放域文档视觉问答的统一数据集集合,涵盖了多种文档类型和格式。OpenDocVQA 为在开放域设置下训练和评估视觉富文档上的检索与问答模型提供了全面的资源。实验表明,VDocRAG 大幅优于传统的基于文本的 RAG,并具有强大的泛化能力,凸显了面向真实世界文档的有效 RAG 范式的潜力。

关键词

引用

@article{arxiv.2504.09795,
  title  = {VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents},
  author = {Ryota Tanaka and Taichi Iki and Taku Hasegawa and Kyosuke Nishida and Kuniko Saito and Jun Suzuki},
  journal= {arXiv preprint arXiv:2504.09795},
  year   = {2025}
}

备注

Accepted by CVPR 2025; project page: https://vdocrag.github.io