重建您的之前对话!对GPT模型对话中隐私泄露风险的全面调查
密码学与安全
2024-10-08 v2 人工智能
计算与语言
机器学习
摘要
近期大型语言模型(GPT代表模型)取得了显著进展。用户经常与托管在云端的GPT模型进行多轮私人对话以优化任务。然而,这种操作模式引入了额外的攻击面,尤其是在自定义GPT和被劫持的聊天会话中。本文引入一种直截而当且高效的对话重建攻击。该攻击针对GPT模型与善意用户之间之前对话的内容,即善意用户在与GPT模型交互期间的输入内容。对手可以通过设计的恶意提示诱导GPT模型泄露此类内容。我们在此攻击下,对GPT模型交互中的隐私风险进行全面考察,发现GPT-4具有相当大的抗性。我们提出两种针对改进对话重建的高级攻击,证明这些高级技术在所有模型下均存在显著的隐私泄露。评估各种防御机制后,我们发现它们对这些攻击无效。我们的发现凸显了GPT模型交互中隐私易被危及的程度,呼吁社区保护这些模型能力可能被滥用的潜在风险。
引用
@article{arxiv.2402.02987,
title = {Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models},
author = {Junjie Chu and Zeyang Sha and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2402.02987},
year = {2024}
}
备注
Accepted in EMNLP 2024. 14 pages, 10 figures