RePCS:诊断LLM驱动的检索增强生成中的数据记忆
机器学习
2025-06-19 v1 人工智能
摘要
检索增强生成已成为用当前外部信息更新大型语言模型响应的常见策略。然而,模型可能仍会依赖记忆的训练数据,绕过检索到的证据,并产生受污染的输出。我们引入了检索路径污染评分,这是一种无需模型访问或重新训练即可检测此类行为的诊断方法。RePCS比较两条推理路径:(i) 仅使用查询的参数路径,以及(ii) 使用查询和检索到的上下文的检索增强路径,通过计算其输出分布之间的Kullback-Leibler散度。低散度表明检索到的上下文影响极小,指示潜在的记忆。该过程与模型无关,无需梯度或内部状态访问,并且仅增加一次额外的前向传递。我们进一步推导了PAC风格的保证,将KL阈值与用户定义的假阳性和假阴性率联系起来。在Prompt-WNQA基准测试上,RePCS实现了0.918的ROC-AUC。该结果比最强先验方法高出6.5个百分点,同时在NVIDIA T4 GPU上的延迟开销低于4.7%。RePCS提供了一种轻量级、黑盒的安全保障,用于验证RAG系统是否有意义地利用了检索,使其在安全关键应用中特别有价值。
引用
@article{arxiv.2506.15513,
title = {RePCS: Diagnosing Data Memorization in LLM-Powered Retrieval-Augmented Generation},
author = {Le Vu Anh and Nguyen Viet Anh and Mehmet Dik and Luong Van Nghia},
journal= {arXiv preprint arXiv:2506.15513},
year = {2025}
}
备注
11 pages, 7 figures, 5 tables