中文

现在,写一篇关于该话题的文章:Crescendo 多轮 LLM 越狱攻击

密码学与安全 2025-02-27 v3 人工智能

摘要

大型语言模型 (LLM) 在日益流行的应用中正越来越受到采纳。这些 LLM 被严格对齐以抵抗非法或不道德的话题,以避免贡献于负责任的 AI 伤害。然而,近期的一系列攻击,称为越狱攻击 (jailbreaks),旨在克服这种对齐方式。直观地说,越狱攻击旨在缩小模型能够做什么与其愿意做什么之间的差距。本文介绍一种新颖的越狱攻击方法,称为 Crescendo。与现有的越狱方法不同,Crescendo 是一种简单多轮越狱,以看似无害的方式与模型交互。它以关于任务的一般性提示或问题开始,然后通过逐步引用模型的回复来逐步升级对话,从而实现成功的越狱。我们在各种公开系统上评估了 Crescendo,包括 ChatGPT、Gemini Pro、Gemini-Ultra、LlaMA-2 70b 和 LlaMA-3 70b Chat,以及 Anthropic Chat。我们的结果表明 Crescendo 的有效性强,对所有评估到的模型和任务都实现了高攻击成功率。此外,我们还演示了 Crescendomation,这是一个自动化 Crescendo 攻击的工具,并通过我们的评估展示了其对最先进模型的有效性。Crescendomation 在 AdvBench 数据集子集上超越了其他最先进的越狱技术,GPT-4 上实现 29-61% 的更高性能,Gemini-Pro 上实现 49-71% 的更高性能。最后,我们还展示了 Crescendo 能够对多模态模型进行越狱。

关键词

引用

@article{arxiv.2404.01833,
  title  = {Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack},
  author = {Mark Russinovich and Ahmed Salem and Ronen Eldan},
  journal= {arXiv preprint arXiv:2404.01833},
  year   = {2025}
}

备注

Accepted at USENIX Security 2025