检索增强生成中的来源归属
机器学习
2025-07-08 v1 人工智能
摘要
虽然Shapley值等归属方法在传统机器学习中广泛用于解释特征或训练数据的重要性,但其在大语言模型(LLM)中,特别是检索增强生成(RAG)系统中的应用仍处于初级阶段且面临挑战。其主要障碍是巨大的计算成本,即每次效用函数评估都涉及昂贵的LLM调用,导致直接的货币和时间支出。本文探讨了改造Shapley-based归属方法以识别RAG中有影响力检索文档的可行性和有效性。我们比较Shapley与更计算可行的近似方法以及现有LLM归属方法。本文的工作旨在:(1)系统地将既定归属原则应用于RAG文档级别场景;(2)量化SHAP近似如何在最小化昂贵LLM交互的同时镜像精确归属;(3)评估其在识别关键文档方面的实际可解释性,尤其是在冗余、互补和协同等复杂文档间关系的情况下。该研究旨在弥合强大归属技术与LLM-based RAG系统实际约束之间的鸿沟,提供实现可靠且可负担的RAG可解释性见解。
引用
@article{arxiv.2507.04480,
title = {Source Attribution in Retrieval-Augmented Generation},
author = {Ikhtiyor Nematov and Tarik Kalai and Elizaveta Kuzmenko and Gabriele Fugagnoli and Dimitris Sacharidis and Katja Hose and Tomer Sagi},
journal= {arXiv preprint arXiv:2507.04480},
year = {2025}
}