遵循我的指令并泄露秘密:从检索增强生成系统中进行可扩展的数据提取
计算与语言
2024-10-08 v3 人工智能
密码学与安全
机器学习
摘要
检索增强生成(RAG)通过在测试时引入外部知识来改进预训练模型,从而实现定制化适应。我们研究了检索上下文RAG语言模型(LM)中数据存储泄露的风险。我们表明,攻击者可以利用LM的指令遵循能力,通过提示注入轻松地从基于指令微调LM构建的RAG系统的数据存储中逐字提取文本数据。该漏洞存在于多种现代LM中,包括Llama2、Mistral/Mixtral、Vicuna、SOLAR、WizardLM、Qwen1.5和Platypus2,并且随着模型规模的扩大,可利用性加剧。我们还研究了RAG设置对数据可提取性的多种影响,表明遵循意外指令来复述数据可能是现代LM未能有效利用上下文的结果,并进一步表明这种漏洞可以通过位置偏差消除策略得到极大缓解。将我们的研究扩展到生产级RAG模型GPTs,我们设计了一种攻击,能够在25个随机选择的定制GPTs上以100%的成功率导致数据存储泄露,最多仅需2次查询;通过仅使用GPTs自身生成的100个查询进行提示,我们从一本77,000词的书中逐字提取了41%的文本数据,从一个1,569,000词的语料库中提取了3%的文本数据。
引用
@article{arxiv.2402.17840,
title = {Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems},
author = {Zhenting Qi and Hanlin Zhang and Eric Xing and Sham Kakade and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2402.17840},
year = {2024}
}