中文

HarmBench:用于自动化红队测试与稳健拒绝的标准化评估框架

机器学习 2024-02-28 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

自动化红队测试在揭示和减轻与大语言模型(LLMs)恶意使用相关的风险方面具有巨大潜力,但该领域缺乏一个标准化的评估框架来严格评估新方法。为了解决这个问题,我们引入了 HarmBench,一个用于自动化红队测试的标准化评估框架。我们识别了红队测试评估中以前未被考虑的几个理想属性,并系统地设计了 HarmBench 以满足这些标准。使用 HarmBench,我们对 18 种红队测试方法和 33 个目标 LLM 及防御措施进行了大规模比较,产生了新的见解。我们还引入了一种高效的对抗训练方法,该方法在广泛的攻击范围内极大地增强了 LLM 的稳健性,展示了 HarmBench 如何实现攻击和防御的协同开发。我们在 https://github.com/centerforaisafety/HarmBench 开源了 HarmBench。

关键词

引用

@article{arxiv.2402.04249,
  title  = {HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal},
  author = {Mantas Mazeika and Long Phan and Xuwang Yin and Andy Zou and Zifan Wang and Norman Mu and Elham Sakhaee and Nathaniel Li and Steven Basart and Bo Li and David Forsyth and Dan Hendrycks},
  journal= {arXiv preprint arXiv:2402.04249},
  year   = {2024}
}

备注

Website: https://www.harmbench.org