多轮LLM交互中的提示泄露效应与防御策略
密码学与安全
2024-07-30 v3 人工智能
计算与语言
摘要
提示泄露在LLM应用中构成了严重的安全和隐私威胁。系统提示的泄露可能损害知识产权,并作为攻击者的对抗性侦察。目前缺乏对提示泄露威胁和缓解策略的系统评估,特别是对于多轮LLM交互。在本文中,我们系统地研究了10个闭源和开源LLM在四个领域中对提示泄露的脆弱性。我们设计了一个独特的威胁模型,利用LLM的谄媚效应,在多轮设置中将平均攻击成功率(ASR)从17.7%提高到86.2%。我们的标准化设置进一步允许剖析特定提示内容(如任务指令和知识文档)的泄露。我们测量了7种黑盒防御策略的缓解效果,并微调了一个开源模型以防御泄露尝试。我们针对我们的威胁模型提出了不同的防御组合,包括成本分析。我们的研究强调了构建安全LLM应用的关键要点,并为多轮LLM交互的研究提供了方向。
引用
@article{arxiv.2404.16251,
title = {Prompt Leakage effect and defense strategies for multi-turn LLM interactions},
author = {Divyansh Agarwal and Alexander R. Fabbri and Ben Risher and Philippe Laban and Shafiq Joty and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2404.16251},
year = {2024}
}