你无法窃取虚无:通过系统向量缓解大语言模型的提示泄露
密码学与安全
2025-09-29 v1 人工智能
计算与语言
摘要
大语言模型(LLM)已被广泛应用于各种应用中,利用定制的系统提示来执行各种任务。面对潜在的系统提示泄露风险,模型开发者实施了防止泄露的策略,主要是通过在遇到已知攻击模式时禁止 LLM 重复其上下文。然而,这仍然容易受到新的和不可预见的提示泄露技术的攻击。在本文中,我们首先引入一种简单而有效的提示泄露攻击来揭示此类风险。我们的攻击能够从各种基于 LLM 的应用中提取系统提示,甚至从 SOTA LLM 模型(如 GPT-4o 或 Claude 3.5 Sonnet)中提取。我们的发现进一步启发了我们通过在上下文中不包含系统提示来寻找问题的根本解决方案。为此,我们提出了 SysVec,一种将系统提示编码为内部表示向量而非原始文本的新方法。通过这样做,SysVec 在保留 LLM 核心语言能力的同时,最大限度地降低了未经授权泄露的风险。值得注意的是,这种方法不仅增强了安全性,还提高了模型的一般指令遵循能力。实验结果表明,SysVec 有效缓解了提示泄露攻击,保留了 LLM 的功能完整性,并有助于缓解长上下文场景中的遗忘问题。
引用
@article{arxiv.2509.21884,
title = {You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors},
author = {Bochuan Cao and Changjiang Li and Yuanpu Cao and Yameng Ge and Ting Wang and Jinghui Chen},
journal= {arXiv preprint arXiv:2509.21884},
year = {2025}
}
备注
29 pages, 10 tables, 6figures, accepted by CCS 25