中文

技巧集:大语言模型越狱攻击基准测试

密码学与安全 2024-11-07 v3 人工智能 计算与语言

摘要

尽管大语言模型(LLM)在零样本执行复杂任务方面展现了显著能力,但它们容易受到越狱攻击,并被操纵产生有害输出。最近,越来越多的研究将越狱攻击分为令牌级和提示级攻击。然而,先前的工作主要忽视了越狱攻击的多种关键因素,大多数研究集中于LLM的脆弱性,缺乏对防御增强型LLM的探索。为解决这些问题,我们引入了JailTrickBench\textbf{JailTrickBench}来评估各种攻击设置对LLM性能的影响,并为越狱攻击提供基线,鼓励采用标准化评估框架。具体来说,我们从目标级和攻击级两个角度评估了在LLM上实施越狱攻击的八个关键因素。我们进一步在两个广泛使用的数据集上,针对六种防御方法进行了七种代表性越狱攻击,涵盖了约354次实验,在A800-80G上消耗了约55,000 GPU小时。我们的实验结果强调了需要标准化基准测试来评估这些攻击对防御增强型LLM的效果。我们的代码可在https://github.com/usail-hkust/JailTrickBench获取。

关键词

引用

@article{arxiv.2406.09324,
  title  = {Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs},
  author = {Zhao Xu and Fan Liu and Hao Liu},
  journal= {arXiv preprint arXiv:2406.09324},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024