中文

用于大型语言模型优化基础攻击的索引梯度

计算与语言 2024-12-17 v2

摘要

尽管通过对齐技术训练大型语言模型(LLM)以增强生成内容的安全性,但这些模型仍然容易受到越狱攻击的威胁,越狱是一种揭示LLM安全漏洞的对抗性攻击方法。值得注意的是,贪心坐标梯度(GCG)方法已显示出能够自动生成越狱最先进LLM的对抗后缀的能力。然而,GCG涉及的优化过程耗时较长,导致越狱管道效率低下。在本文中,我们研究了GCG的过程,识别了GCG优化的关键瓶颈——间接效应问题。为此,我们提出了模型攻击梯度索引GCG(MAGIC),通过利用后缀标记的梯度信息来解决间接效应问题,从而通过较少的计算和更少的迭代次数加速该过程。我们在AdvBench上的实验表明,MAGIC实现了最高可达1.5倍的加速速度,同时保持与其他基线方法相当甚至更高的攻击成功率(ASR)。我们的MAGIC在Llama-2上的ASR达到74%,在对GPT-3.5进行迁移攻击时达到54%。代码可在https://github.com/jiah-li/magic获取。

关键词

引用

@article{arxiv.2412.08615,
  title  = {Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models},
  author = {Jiahui Li and Yongchang Hao and Haoyu Xu and Xing Wang and Yu Hong},
  journal= {arXiv preprint arXiv:2412.08615},
  year   = {2024}
}

备注

13 pages,2 figures, accepted by COLING 2025