中文

PandaGuard:系统化评估 LLM 安全性对越狱攻击的防御

密码学与安全 2025-05-27 v3 计算与语言

摘要

大语言模型(LLM)已取得显著进展,但仍对称为越狱的对抗性提示词而言脆弱,这些提示词可绕过安全对齐并激发有害输出。尽管在 LLM 安全研究中已有不少努力,但现有评估往往碎片化,仅聚焦于单一攻击或防御技术,且缺乏系统化、可复现的分析。本文引入 PandaGuard,一个统一且模块化的框架,将 LLM 越狱安全建模为由攻击者、防御者和裁判官组成的多智能体系统。我们的框架在灵活的插件架构下实现了 19 种攻击方法和 12 种防御机制,以及多种判决策略,支持多种 LLM 接口、多种交互模式和配置驱动的实验,以提高可复现性和实际部署。基于该框架,我们开发了 PandaBench,一个综合性基准,评估这些攻击/防御方法在 49 个 LLM 和各种判决方法之间的相互作用,需执行超过 30 亿个 token。我们的广泛评估揭示了模型脆弱性、防御成本效益权衡以及裁判官一致性的关键见识。我们发现没有任何单一防御方法在所有维度上都最优,且裁判官的不一致会引入非平凡的安全评估方差。我们公开代码、配置和评估结果,以支持 LLM 安全领域的透明和可复现研究。

关键词

引用

@article{arxiv.2505.13862,
  title  = {PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks},
  author = {Guobin Shen and Dongcheng Zhao and Linghao Feng and Xiang He and Jihang Wang and Sicheng Shen and Haibo Tong and Yiting Dong and Jindong Li and Xiang Zheng and Yi Zeng},
  journal= {arXiv preprint arXiv:2505.13862},
  year   = {2025}
}