MHier-RAG:通过层级和多粒度推理实现面向富视觉文档问答的多模态RAG
多媒体
2025-10-06 v3 信息检索
摘要
多模态长上下文文档问答任务旨在定位和整合分布在多页中的多模态证据(如文本、表格、图表、图像和布局),用于问题理解和答案生成。现有方法可分为基于大型视觉语言模型(LVLM)和基于检索增强生成(RAG)的方法。然而,前者容易产生幻觉,而后者则面临模态间脱节和跨页碎片化的问题。为应对这些挑战,提出了一种新颖的多模态RAG模型,名为MHier-RAG,它利用跨长距离页面的文本和视觉信息来促进对富视觉文档的准确问答。设计了一种层级索引方法,整合了扁平化的页内块和拓扑化的跨页块,以共同建立页内多模态关联和长距离跨页依赖关系。通过联合相似度评估和基于大语言模型(LLM)的重排序,提出了一种多粒度语义检索方法,包括页面级的父页面检索和文档级的摘要检索,以促进多模态证据连接以及长距离证据整合与推理。在公共数据集MMLongBench-Doc和LongDocURL上进行的实验结果证明了我们的MHier-RAG方法在理解和回答富含模态的多页文档方面的优越性。
引用
@article{arxiv.2508.00579,
title = {MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning},
author = {Ziyu Gong and Chengcheng Mai and Yihua Huang},
journal= {arXiv preprint arXiv:2508.00579},
year = {2025}
}
备注
Comments: Update Title, Author, Abstract, etc