中文

链式证据:基于像素的迭代检索增强生成可视化归因

计算机视觉与模式识别 2026-05-26 v2 人工智能 计算与语言 信息检索

摘要

迭代检索增强生成(iRAG)已成为一种强大的范式,用于通过逐步检索和推理外部文档来回答复杂的多跳问题。然而,当前系统主要 operate on 解析文本,存在两个关键瓶颈:(1)粗粒度归因,用户需要基于模糊的文本引用手动定位 lengthy documents 中的证据;(2)视觉语义丢失,将富有视觉信息的文档(如演示文稿、带图表的PDF)转换为文本,会丢弃推理所必需的空间逻辑和布局线索。为弥合这一差距,我们提出了链式证据(Chain of Evidence, CoE),一个无检索器依赖的视觉归因框架,利用视觉语言模型直接对检索到的文档候选截图进行推理。CoE消除了格式特定的解析,输出精确的边界框,在检索到的候选集中可视化完整的推理链。我们在两个不同的基准上评估了CoE:一个来自2WikiMultiHopQA的大规模结构化网页数据集(Wiki-CoE),以及一个包含复杂图表和自由布局演示文稿的挑战性数据集(SlideVQA)。实验表明,微调的Qwen3-VL-8B-Instruct模型在需要视觉布局理解的场景中显著优于基于文本的基线方法,同时为像素级可解释的iRAG建立了一个无检索器依赖的解决方案。我们的代码可在https://github.com/PeiYangLiu/CoE.git获取。

关键词

引用

@article{arxiv.2605.01284,
  title  = {Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation},
  author = {Peiyang Liu and Ziqiang Cui and Xi Wang and Di Liang and Wei Ye},
  journal= {arXiv preprint arXiv:2605.01284},
  year   = {2026}
}