ViDoRAG:基于动态迭代推理智能体的视觉文档检索增强生成
计算机视觉与模式识别
2025-06-04 v2 人工智能
计算与语言
信息检索
摘要
传统检索增强生成(RAG)方法在理解视觉丰富文档信息时仍面临重大挑战。现有基准主要聚焦于基于图像的问题 answering(QA),忽视了在密集视觉文档中进行高效检索、理解与推理的根本难题。为弥合这一差距,我们提出了 ViDoSeek—a 一个新颖的数据集,用于评估视觉丰富文档上需要复杂推理的RAG性能。基于该数据集,我们识别出当前RAG方法的关键局限性:(i)纯视觉检索方法难以有效整合文本与视觉特征;(ii)先前方法往往分配不足的推理标记,限制了其效果。为此,我们提出了 ViDoRAG——一个针对视觉文档复杂推理的多智能体RAG框架。ViDoRAG采用基于高斯混合模型(GMM)的混合策略,以有效处理多模态检索。为进一步激发模型推理能力,我们引入包含探索、概述与反思的迭代智能体工作流程,构建了用于探讨RAG领域测试时规模效应的框架。大量实验表明,在ViDoSeek基准上,ViDoRAG的效果和通用性得到充分验证。值得注意的是,ViDoRAG在竞争性ViDoSeek基准上超越现有方法超过10%。代码已公开于 https://github.com/Alibaba-NLP/ViDoRAG。
引用
@article{arxiv.2502.18017,
title = {ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents},
author = {Qiuchen Wang and Ruixue Ding and Zehui Chen and Weiqi Wu and Shihang Wang and Pengjun Xie and Feng Zhao},
journal= {arXiv preprint arXiv:2502.18017},
year = {2025}
}