静默泄露:通过良性查询对检索增强生成系统的隐式知识提取攻击
密码学与安全
2025-10-01 v2 人工智能
摘要
检索增强生成 (RAG) 系统通过整合外部知识库来增强大语言模型 (LLM),但可能使其暴露于提取攻击,导致潜在的版权和隐私风险。然而,现有提取方法通常依赖恶意输入如提示注入或越狱,使其易于通过输入或输出水平检测被发现。本文引入隐式知识提取攻击 (IKEA),通过良性查询对 RAG 系统进行知识提取。具体而言,IKEA 首先利用锚定概念-与内部知识相关的关键词-生成外观自然的查询,然后设计两种机制导致锚定概念充分“探索” RAG 的知识: (1) 经验反思抽样,该方法根据过去的查询-响应历史抽样锚定概念,确保其与主题相关; (2) 可信区域导向变异,该方法在相似性约束下迭代变异锚定概念,以进一步利用嵌入空间。大量实验表明,IKEA 在各种防御措施下均表现出色,在提取效率和攻击成功率方面分别超过基线 80% 和 90%。此外,基于 IKEA 提取构建的替代 RAG 系统在多个评估任务上的表现与原 RAG 相当,并优于基于基线的 RAG 系统,凸显了 RAG 系统中隐式版权侵权的潜在风险。
引用
@article{arxiv.2505.15420,
title = {Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries},
author = {Yuhao Wang and Wenjie Qu and Shengfang Zhai and Yanze Jiang and Zichen Liu and Yue Liu and Yinpeng Dong and Jiaheng Zhang},
journal= {arXiv preprint arXiv:2505.15420},
year = {2025}
}