对齐语言模型的通用且可迁移对抗攻击
计算与语言
2023-12-22 v2 人工智能
密码学与安全
机器学习
摘要
由于“开箱即用”的大语言模型能够生成大量不良内容,近期工作聚焦于对齐这些模型以试图阻止不合意生成。尽管已有一些成功绕过这些措施的案例——即针对 LLM 的所谓“越狱”——这些攻击需要大量人类巧思且实践中脆弱。在本文中,我们提出一种简单而有效的攻击方法,使对齐语言模型生成不良行为。具体而言,我们的方法寻找一个后缀,当附加到范围广泛的、用于让 LLM 产生不良内容的查询上时,旨在最大化模型给出肯定回应(而非拒绝回答)的概率。然而,我们的方法不依赖人工设计,而是通过贪心与基于梯度的搜索技术相结合自动产生这些对抗后缀,并且优于过去的自动提示生成方法。令人惊讶的是,我们发现该方法生成的对抗提示具有相当的可迁移性,包括迁移到黑盒、公开发布的 LLM。具体而言,我们在多个提示(即请求多种不良内容的查询)以及多个模型(本例中为 Vicuna-7B 和 13B)上训练对抗攻击后缀。如此得到的攻击后缀能够诱导 ChatGPT、Bard 和 Claude 的公开接口,以及 LLaMA-2-Chat、Pythia、Falcon 等开源 LLM 产生不良内容。总体而言,本工作显著推进了针对对齐语言模型的对抗攻击的 SOTA,提出了关于如何防止此类系统产生不良信息的重要问题。代码见 github.com/llm-attacks/llm-attacks。
引用
@article{arxiv.2307.15043,
title = {Universal and Transferable Adversarial Attacks on Aligned Language Models},
author = {Andy Zou and Zifan Wang and Nicholas Carlini and Milad Nasr and J. Zico Kolter and Matt Fredrikson},
journal= {arXiv preprint arXiv:2307.15043},
year = {2023}
}
备注
Website: http://llm-attacks.org/