MAD-MAX:用于自动化 LLM 红队的模块化与多样化恶意攻击混合
机器学习
2025-06-19 v2
摘要
随着 LLM 使用的快速增长,其产生有害输出的越狱漏洞已成为重大安全风险。随着新越狱策略的出现以及模型通过微调发生改变,持续测试安全漏洞是必要的。现有的红队方法在成本效率、攻击成功率、攻击多样性或新攻击类型出现时的可扩展性方面存在不足。我们通过用于自动化 LLM 红队的模块化与多样化恶意攻击混合 (MAD-MAX) 来应对这些挑战。MAD-MAX 自动将攻击策略分配到相关的攻击集群中,为恶意目标选择最相关的集群,然后结合所选集群中的策略,以实现具有高攻击成功率的多样化新型攻击。MAD-MAX 进一步在红队的每次迭代中合并有潜力的攻击以提升性能,并引入相似性过滤器来剔除相似攻击以提高成本效率。MAD-MAX 方法设计为易于扩展新发现的攻击策略,并在攻击成功率 (ASR) 和实现越狱所需的查询次数方面显著优于著名的红队方法带剪枝的攻击树 (TAP)。在我们的基准测试中,MAD-MAX 在 GPT-4o 和 Gemini-Pro 上成功越狱了 97% 的恶意目标,而 TAP 为 66%。MAD-MAX 仅需平均 10.9 次对目标 LLM 的查询即可实现这一点,而 TAP 需要 23.3 次。警告:本文包含具有冒犯性的内容。
引用
@article{arxiv.2503.06253,
title = {MAD-MAX: Modular And Diverse Malicious Attack MiXtures for Automated LLM Red Teaming},
author = {Stefan Schoepf and Muhammad Zaid Hameed and Ambrish Rawat and Kieran Fraser and Giulio Zizzo and Giandomenico Cornacchia and Mark Purcell},
journal= {arXiv preprint arXiv:2503.06253},
year = {2025}
}
备注
Data in Generative Models Workshop: The Bad, the Ugly, and the Greats (DIG-BUGS) at ICML 2025