中文

JailbreakRadar:针对大语言模型越狱攻击的综合评估

密码学与安全 2025-05-27 v3 人工智能 计算与语言 机器学习

摘要

越狱攻击旨在绕过大型语言模型(LLMs)的安全防护。虽然研究人员已深入提出了不同的越狱攻击方法,但这些工作往往是孤立进行的——要么设置未对齐,要么仅比较有限范围的方法。为了填补这一空白,我们对各种越狱攻击进行了大规模评估。我们收集了 17 种具有代表性的越狱攻击,总结了它们的特征,并建立了一种新的越狱攻击分类法。随后,我们在 9 个对齐的 LLMs 上,针对来自 16 个违规类别的 160 个禁止性问题,进行了全面的测量和消融研究。此外,我们在八种高级防御机制下测试了越狱攻击。基于我们的分类法和实验,我们识别出一些重要模式,例如基于启发式的攻击可以实现高攻击成功率,但容易被防御机制缓解,从而导致实用性较低。我们的研究为未来关于越狱攻击和防御的研究提供了有价值的见解。我们希望我们的工作能帮助社区避免增量式工作,并为从业者提供一个有效的基准工具。

关键词

引用

@article{arxiv.2402.05668,
  title  = {JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs},
  author = {Junjie Chu and Yugeng Liu and Ziqing Yang and Xinyue Shen and Michael Backes and Yang Zhang},
  journal= {arXiv preprint arXiv:2402.05668},
  year   = {2025}
}

备注

Correct typos and update new experiment results. Accepted in ACL 2025. 25 pages, 12 figures