中文

Faster-GCG:针对对齐型大语言模型的高效离散优化越狱攻击

机器学习 2026-05-20 v2 人工智能 计算与语言 密码学与安全

摘要

对齐型大语言模型(LLM)因其安全性而受到广泛关注,尤其是在通过对抗性提示绕过警戒线的越狱攻击方面。目前已有的研究方法中,贪心坐标梯度(GCG)攻击通过离散标记优化实现了自动化越狱;然而,其低采样效率限制了实际应用。具体而言,由于底层离散优化问题的固有难度,GCG 需要约 25.6 万次评估才能实现令人满意的越狱成功率。本文识别了限制 GCG 采样效率的三个关键因素:不准确的梯度估计、低效的均匀抽样以及对已探索后缀的重复评估。为此,我们提出了 Faster-GCG,这是一种 GCG 的优化变体,采用基于距离的正则化以改进估计,采用温度控制抽样以实现更有效的探索,并引入访问后缀标记机制以避免冗余评估。Faster-GCG 将所需评估次数降至 3.2 万,实现了约 8 倍的采样效率提升和 7 倍的运行时间缩减。于是,在该预算下,Faster-GCG 在五个对齐型 LLM 上实现了 78.1% 的平均越狱成功率,并对 Qwen3.5-4B 实现了 88.7% 的成功率,超越了当前最先进的白盒越狱方法。

关键词

引用

@article{arxiv.2410.15362,
  title  = {Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models},
  author = {Xiao Li and Wei Zhang and Zhuhong Li and Qiongxiu Li and Shei PernChua and BingZe Lee and Jinghao Cui and Yifan Huang and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2410.15362},
  year   = {2026}
}

备注

18 pages, new version