中文

面向异构数据上的RAG系统的证据情境化与反事实归因

计算与语言 2024-12-24 v3 信息检索

摘要

检索增强生成(RAG)作为与企业自有数据交互的ConvQA(对话式问答)系统的 backbone。RAG系统中,检索器会从集合中检索段落以响应问题,然后这些段落被包含在大型语言模型(LLM)的提示中,用于生成自然语言(NL)答案。然而,当今许多RAG系统存在两个不足:(i)检索到的段落通常包含原始文本,缺乏适当的文档情境,严重影响检索和答案质量;(ii)归因策略通常仅依赖于答案与检索段落之间的相似性,从而仅生成合情合理但非因果的解释。在本工作中,我们展示了RAGONITE,一个解决上述问题的RAG系统:(i)通过源元数据和周围文本对证据进行情境化处理;(ii)计算反事实归因,这是一种因果解释方法,其中证据对答案的贡献通过删除该证据后获得的答案与原始响应之间的相似性来确定。为评估我们的提议,我们发布了一个新的基准ConfQuestions:包含300个手工创建的对话问题,每个问题都有英文和德文版本,伴随真实URL、完成的问题和来自215个公共Confluence页面的答案。这些文档典型于企业维基空间,包含异构元素。在ConfQuestions上使用RAGONITE的实验显示了我们想法的可行性:情境化处理改进了RAG性能,反事实解释超过标准归因。

关键词

引用

@article{arxiv.2412.10571,
  title  = {Evidence Contextualization and Counterfactual Attribution for Conversational QA over Heterogeneous Data with RAG Systems},
  author = {Rishiraj Saha Roy and Joel Schlotthauer and Chris Hinze and Andreas Foltyn and Luzian Hahn and Fabian Kuech},
  journal= {arXiv preprint arXiv:2412.10571},
  year   = {2024}
}

备注

Accepted at WSDM 2025, 8 pages