超越上下文的文档理解多模态检索增强生成综述
计算与语言
2026-04-21 v3 计算机视觉与模式识别
摘要
文档理解是金融分析到科学发现等应用的关键环节。当前方法,无论是将 OCR 处理结果输入大语言模型 (LLM) 的管线,还是直接使用原生多模态大语言模型 (MLLM),都面临关键局限:前者丢失结构细节,后者在上下文建模方面受限。检索增强生成 (RAG) 通过引入外部数据来为模型提供依托,但文档的多模态特性(即结合文本、表格、图表和布局)需要更高级的范式:多模态 RAG。该方法实现对所有模态的全面检索与推理,实现文档智能的全面化。为此本文提出了文档 AI 领域多模态 RAG 的系统性综述。我们提出基于域、检索模态和细粒度的分类框架,综述涉及图结构和智能体框架的最新进展。我们还总结了关键数据集、基准、应用及行业部署,并强调在效率、细粒度表征和鲁棒性方面的开放挑战,为文档 AI 的未来进展提供了路线图。
引用
@article{arxiv.2510.15253,
title = {Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding},
author = {Sensen Gao and Shanshan Zhao and Xu Jiang and Lunhao Duan and Yong Xien Chng and Qing-Guo Chen and Weihua Luo and Kaifu Zhang and Jia-Wang Bian and Mingming Gong},
journal= {arXiv preprint arXiv:2510.15253},
year = {2026}
}
备注
Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document