基于视觉来源归因的检索增强生成
信息检索
2024-12-20 v1
摘要
带来源归因的生成对于增强检索增强生成(RAG)系统的可验证性至关重要。然而,现有的RAG方法主要将生成内容链接到文档级别的引用,使得用户难以在多个内容丰富的检索文档中定位证据。为此,我们提出了一种结合答案生成与视觉来源归因的方法——检索增强生成带视觉来源归因(VISA)。利用大型视觉语言模型(VLM),VISA识别证据并在检索文档截图中用边界框突出显示支持所生成答案的确切区域。为评估其有效性,我们构建了两个数据集:基于爬取的维基百科网页截图的Wiki-VISA,以及源自PubLayNet并针对医疗领域定制的Paper-VISA。实验结果表明,VISA在保持文档原始外观的同时,能够实现视觉来源归因,并突显了改进之路。代码、数据和模型检查点将发布。
引用
@article{arxiv.2412.14457,
title = {VISA: Retrieval Augmented Generation with Visual Source Attribution},
author = {Xueguang Ma and Shengyao Zhuang and Bevan Koopman and Guido Zuccon and Wenhu Chen and Jimmy Lin},
journal= {arXiv preprint arXiv:2412.14457},
year = {2024}
}