AmpleGCG:学习通用且可迁移的对抗后缀生成模型以越狱开源与闭源 LLMs
计算与语言
2024-11-26 v3
摘要
随着大语言模型(LLMs)日益普及并集成到自主系统中,确保其安全性势在必行。尽管在安全对齐方面取得了重大进展,最近的工作 GCG~\citep{zou2023universal} 提出了一种离散词元优化算法,并选择损失最低的单个后缀以成功越狱对齐的 LLMs。在本工作中,我们首先讨论了在 GCG 优化越狱过程中仅选择损失最低后缀的缺点,并揭示了中间步骤中被遗漏的成功后缀。此外,我们利用这些成功后缀作为训练数据来学习一个生成模型,命名为 AmpleGCG,该模型捕捉了给定有害查询下对抗后缀的分布,并能在几秒钟内为任何有害查询快速生成数百个后缀。AmpleGCG 在两个对齐的 LLMs(Llama-2-7B-chat 和 Vicuna-7B)上实现了接近 100% 的攻击成功率(ASR),超越了两个最强的攻击基线。更有趣的是,AmpleGCG 也能无缝迁移以攻击不同模型,包括闭源 LLMs,在最新的 GPT-3.5 上实现了 99% 的 ASR。总而言之,我们的工作通过训练一个对抗后缀生成模型放大了 GCG 的影响,该模型对任何有害查询具有普适性,且能从攻击开源 LLMs 迁移至攻击闭源 LLMs。此外,它能在仅 4 秒内为一个有害查询生成 200 个对抗后缀,使其更难以被防御。
引用
@article{arxiv.2404.07921,
title = {AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs},
author = {Zeyi Liao and Huan Sun},
journal= {arXiv preprint arXiv:2404.07921},
year = {2024}
}
备注
Published as a conference paper at COLM 2024 (https://colmweb.org/index.html)