$G^2$-Reader:用于多模态文档问答的双演化图
计算与语言
2026-01-30 v1
摘要
检索增强生成是处理长文档问答的实用范式,但在文本、表格和图形跨越多页交织的多模态阅读中仍显脆弱。首先,平面分块破坏文档本机结构和跨模态对齐,导致难以在孤立情况下解释的语义片段。其次,even iterative retrieval 在长上下文中也会失败,因循环部分证据或偏离无关部分以积累噪声,由于每一步仅受当前片段指引而缺乏持久的全局搜索状态。我们引入-Reader,一个双图系统,以解决这两个问题。它演化一个内容图以保留文档本机结构和跨模态语义,同时维护一个规划图——一个由子问题组成的有向无环图,用于跟踪中间发现并指导逐步导航以完成证据。在VisDoMBench上的五个多模态领域中,-Reader使用Qwen3-VL-32B-Instruct达到了66.21%的平均准确率,优于强基准和独立的GPT-5(53.08%)。
引用
@article{arxiv.2601.22055,
title = {$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA},
author = {Yaxin Du and Junru Song and Yifan Zhou and Cheng Wang and Jiahao Gu and Zimeng Chen and Menglan Chen and Wen Yao and Yang Yang and Ying Wen and Siheng Chen},
journal= {arXiv preprint arXiv:2601.22055},
year = {2026}
}