中文

VisRAG:基于视觉的多模态文档检索增强生成

信息检索 2025-03-04 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

检索增强生成(RAG)是一种有效技术,使大型语言模型(LLM)能够利用外部知识源进行生成。然而,当前的RAG系统仅基于文本,无法利用在现实世界多模态文档中发挥关键作用的视觉信息(如布局和图像)。本文提出VisRAG,通过建立基于视觉语言模型(VLM)的RAG管道来解决此问题。在该管道中,文档不首先被解析为文本,而是直接使用VLM作为图像进行嵌入和检索,以增强VLM的生成。与传统基于文本的RAG相比,VisRAG最大程度保留和利用原始文档中的数据信息,消除了在解析过程中引入的信息损失。我们收集了开源数据和合成数据来训练VisRAG中的检索器,并探索了多种生成方法。实验表明,VisRAG在检索和生成阶段均优于传统RAG,实现了传统基于文本的RAG管道的端到端性能提升20%-40%。进一步分析表明,VisRAG在有效利用训练数据方面表现出强大的泛化能力,为RAG在多模态文档上提供了有前景的解决方案。我们的代码和数据可在 https://github.com/openbmb/visrag 获取。

关键词

引用

@article{arxiv.2410.10594,
  title  = {VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents},
  author = {Shi Yu and Chaoyue Tang and Bokai Xu and Junbo Cui and Junhao Ran and Yukun Yan and Zhenghao Liu and Shuo Wang and Xu Han and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2410.10594},
  year   = {2025}
}