AutoDAN:基于梯度的可解释大语言模型对抗攻击
密码学与安全
2023-12-15 v2 人工智能
计算与语言
机器学习
摘要
大语言模型(LLMs)的安全对齐可能被手动越狱攻击和(自动)对抗攻击破坏。近期研究表明防御这些攻击是可能的:对抗攻击生成无限但不可读的乱码提示,可由基于困惑度的过滤器检测;手动越狱攻击构造可读提示,但由于依赖人类创造力而数量有限,易于封锁。本文中我们表明这些方案或许过于乐观。我们提出 AutoDAN,一种可解释的、基于梯度的对抗攻击,融合了两类攻击的优势。在越狱与可读性双重目标引导下,AutoDAN 从左至右逐 token 优化并生成,产生可读提示,在绕过困惑度过滤器的同时保持高攻击成功率。值得注意的是,这些从零使用梯度生成的提示是可解释且多样的,并涌现出手动越狱攻击中常见的策略。在使用有限训练数据或单一代理模型时,它们还能泛化至未预见的有害行为,并比不可读对应物更好地迁移至黑盒 LLMs。此外,我们通过使用定制目标自动泄露系统提示,展示了 AutoDAN 的通用性。我们的工作为红队测试 LLMs 及通过可解释性理解越狱机制提供了新途径。
引用
@article{arxiv.2310.15140,
title = {AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models},
author = {Sicheng Zhu and Ruiyi Zhang and Bang An and Gang Wu and Joe Barrow and Zichao Wang and Furong Huang and Ani Nenkova and Tong Sun},
journal= {arXiv preprint arXiv:2310.15140},
year = {2023}
}
备注
Version 2 updates: Added comparison of three more evaluation methods and their reliability check using human labeling. Added results for jailbreaking Llama2 (individual behavior) and included complexity and hyperparameter analysis. Revised objectives for prompt leaking. Other minor changes made