中文

面向检索增强型大语言模型的外部数据提取攻击

密码学与安全 2025-10-06 v1

摘要

近年来,检索增强型大语言模型(RAG)已成为提升大语言模型(LLM)性能的关键范式。通过集成外部检索信息,RAG 能够缓解知识过时、尤其是领域专业知识不足等问题。尽管效果显著,RAG 也引入了外部数据提取攻击(EDEAs)的新风险,敏感或受版权保护的数据可能被原样提取。这种风险在使用私有知识库定制专业 LLM 应用时尤为突出。尽管已有研究探索了这些风险,但往往缺乏形式化框架、鲁棒的攻击性能以及全面评估,仍未回答实际场景中 EDEA 可行性的关键问题。本文首次对抗检索增强型大语言模型的 EDEAs 进行全面研究。我们首先形式化定义 EDEAs,并提出统一框架,将其设计分解为三个组成部分:提取指令、越狱操作和检索触发器。在此框架下,先前的攻击可视为框架内的具体实例。基于此框架,我们开发了 SECRET:一种可扩展且高效的外部数据提取攻击。具体而言,SECRET 包含 (1) 使用 LLM 作为优化器进行自适应优化,以生成针对 EDEAs 的专用越狱提示,以及 (2) 聚类聚焦触发策略,该策略在全局探索与局部开发之间交替,以高效生成有效检索触发器。跨 4 个模型的广泛评估表明,SECRET 显著优于先前攻击,对所有 16 个测试中的 RAG 实例都 highly effective。值得注意的是,SECRET 首次成功提取由 Claude 3.7 Sonnet 提供支持的 RAG 的 35% 数据,而其他攻击仅得 0% 提取率。我们的发现呼吁关注这一新兴威胁。

关键词

引用

@article{arxiv.2510.02964,
  title  = {External Data Extraction Attacks against Retrieval-Augmented Large Language Models},
  author = {Yu He and Yifei Chen and Yiming Li and Shuo Shao and Leyi Qi and Boheng Li and Dacheng Tao and Zhan Qin},
  journal= {arXiv preprint arXiv:2510.02964},
  year   = {2025}
}