中文

JailGuard:针对 LLM 提示攻击的通用检测框架

密码学与安全 2025-03-18 v4

摘要

由大语言模型(LLM)和多模态大语言模型(MLLM)驱动的系统与软件在众多场景中发挥了关键作用。然而,当前的 LLM 系统容易受到提示攻击,其中越狱攻击使 LLM 系统生成有害内容,而劫持攻击则操纵 LLM 系统执行攻击者期望的任务,这凸显了检测工具的必要性。遗憾的是,现有的检测方法通常针对特定攻击定制,导致在检测跨不同模态的各类攻击时泛化能力较差。为解决此问题,我们提出了 JailGuard,一个部署在 LLM 系统之上、针对跨文本与图像模态提示攻击的通用检测框架。JailGuard 基于攻击本质上比良性输入更不鲁棒的原则运行。具体而言,JailGuard 对不可信输入进行变异以生成变体,并利用变体在目标模型上响应的差异来区分攻击样本与良性样本。我们为文本和图像输入实现了 18 个变异器,并设计了变异器组合策略以进一步提升检测泛化能力。在包含 15 种已知攻击类型的数据集上的评估表明,JailGuard 在文本和图像输入上分别实现了 86.14%/82.90% 的最佳检测准确率,比 state-of-the-art 方法高出 11.81%-25.73% 和 12.20%-21.40%。

关键词

引用

@article{arxiv.2312.10766,
  title  = {JailGuard: A Universal Detection Framework for LLM Prompt-based Attacks},
  author = {Xiaoyu Zhang and Cen Zhang and Tianlin Li and Yihao Huang and Xiaojun Jia and Ming Hu and Jie Zhang and Yang Liu and Shiqing Ma and Chao Shen},
  journal= {arXiv preprint arXiv:2312.10766},
  year   = {2025}
}

备注

40 pages, 12 figures