PRSA:针对真实世界提示服务的提示窃取攻击
密码学与安全
2025-06-13 v3 计算与语言
摘要
最近,大型语言模型(LLM)因其卓越的能力而受到广泛关注。提示是LLM功能和性能的核心,使其成为极具价值的资产。对高质量提示日益增长的依赖推动了提示服务的显著增长。然而,这种增长也扩大了提示泄露的可能性,增加了攻击者复制原始功能、创建竞争产品以及严重侵犯开发者知识产权的风险。尽管存在这些风险,真实世界提示服务中的提示泄露仍未得到充分探索。在本文中,我们提出了PRSA,一个实用的攻击框架,用于提示窃取。PRSA通过非常有限的输入-输出分析推断提示的详细意图,并能够成功生成复制原始功能的被盗提示。广泛的评估证明了PRSA在两种主要类型的真实世界提示服务中的有效性。具体来说,与之前的工作相比,它在提示市场中将攻击成功率从17.8%提高到46.1%,在LLM应用商店中从39%提高到52%。值得注意的是,在对OpenAI GPT商店中最受欢迎的教育应用之一“Math”(拥有超过100万次对话)的攻击中,PRSA揭示了一个此前未被发现的隐藏彩蛋。此外,我们的分析表明,提示与其输出之间的互信息越高,泄露风险越大。这一洞察指导了针对PRSA安全威胁的两种潜在防御措施的设计和评估。我们已将这些发现报告给提示服务供应商,包括PromptBase和OpenAI,并积极与他们合作实施防御措施。
引用
@article{arxiv.2402.19200,
title = {PRSA: Prompt Stealing Attacks against Real-World Prompt Services},
author = {Yong Yang and Changjiang Li and Qingming Li and Oubo Ma and Haoyu Wang and Zonghui Wang and Yandong Gao and Wenzhi Chen and Shouling Ji},
journal= {arXiv preprint arXiv:2402.19200},
year = {2025}
}
备注
This is the extended version of the paper accepted at the 34th USENIX Security Symposium (USENIX Security 2025)