PromptKeeper:保护 LLM 的系统提示
密码学与安全
2025-08-28 v3 人工智能
摘要
系统提示被广泛用于引导大语言模型(LLM)的输出。这些提示通常包含业务逻辑和敏感信息,因此对其保护至关重要。然而,对抗性甚至常规的用户查询都可能利用 LLM 的漏洞来暴露这些隐藏的提示。为解决此问题,我们提出了 PromptKeeper,这是一种旨在通过应对两个核心挑战来保护系统提示的防御机制:可靠地检测泄露以及在泄露发生时缓解侧信道漏洞。通过将检测构建为假设检验问题,PromptKeeper 能够有效识别显式和微妙的泄露。在检测到泄露时,它使用虚拟提示重新生成响应,确保在没有泄露时输出与典型交互难以区分。PromptKeeper 确保了对通过对抗性或常规查询进行的提示提取攻击的稳健保护,同时在良性用户交互期间保持了对话能力和运行时效率。
引用
@article{arxiv.2412.13426,
title = {PromptKeeper: Safeguarding System Prompts for LLMs},
author = {Zhifeng Jiang and Zhihua Jin and Guoliang He},
journal= {arXiv preprint arXiv:2412.13426},
year = {2025}
}
备注
Accepted to the Findings of EMNLP 2025. 17 pages, 6 figures, 3 tables