中文

h4rm3l:一种用于可组合越狱攻击合成的语言

密码学与安全 2025-03-26 v4 人工智能 计算与语言 计算机与社会 机器学习

摘要

尽管最先进的(SOTA)广泛部署的大语言模型(LLM)已展现出显著的能力,但其安全过滤器的无效性仍可能对社会造成危害,因为这些过滤器可被称为越狱攻击的提示变换所绕过。当前采用模板化提示数据集和基准测试流水线评估LLM安全性的方法,无法充分覆盖大规模且多样化的越狱攻击集合,导致不安全的LLM被广泛部署。近期研究表明,新的越狱攻击可以通过组合方式推导而来;然而,此前尚未提出一种形式化的可组合越狱攻击表示,该表示除其他优势外,还可通过程序合成方法探索大规模的越狱攻击组合空间。我们提出了h4rm3l,一种通过人类可读的领域特定语言(DSL)填补这一空白的新方法。我们的框架包括:(1)h4rm3l DSL,将越狱攻击形式化为参数化字符串变换基元的组合;(2)一个采用Bandit算法的合成器,可高效生成针对目标黑盒LLM优化的越狱攻击;(3)h4rm3l红队软件工具包,结合前述两个组件和一个与人类判断高度一致的有害LLM行为分类器。我们通过合成一个包含2656个成功新型越狱攻击的数据集(针对6个SOTA开源和专有LLM),并对这些模型进行子集基准测试,展示了h4rm3l的有效性。结果表明,h4rm3l合成的攻击具有多样性,且在SOTA LLM上的成功率超过90%,优于文献中现有的越狱攻击。

关键词

引用

@article{arxiv.2408.04811,
  title  = {h4rm3l: A language for Composable Jailbreak Attack Synthesis},
  author = {Moussa Koulako Bala Doumbouya and Ananjan Nandi and Gabriel Poesia and Davide Ghilardi and Anna Goldie and Federico Bianchi and Dan Jurafsky and Christopher D. Manning},
  journal= {arXiv preprint arXiv:2408.04811},
  year   = {2025}
}

备注

Accepted to the Thirteenth International Conference on Learning Representations (ICLR 2025)