GCG对抗攻击在大型语言模型上的复兴
计算与语言
2025-09-03 v1 人工智能
密码学与安全
机器学习
摘要
梯度基础的对抗性提示方法,如贪心坐标梯度(GCG)算法,已成为针对大型语言模型(LLM)实施攻击的强大方法。本文系统评估了GCG及其仿真退火增强版T-GCG在不同规模开源LLM上的攻击效果。我们使用Qwen2.5-0.5B、LLaMA-3.2-1B和GPT-OSS-20B,在安全导向提示(AdvBench)和推理密集型编码提示上进行测试。我们的研究发现三个关键发现:(1)攻击成功率(ASR)随模型规模而下降,反映出更大模型损失景观的复杂性和非凸性;(2)基于前缀的启发式方法显著高估攻击效果,与GPT-4o语义判断相比,后者提供更严格且更真实的评估;(3)编码相关提示显著比对抗性安全提示更易受攻击,表明推理本身可被用作攻击向量。此外,T-GCG的初步结果表明,模拟退火可为对抗搜索提供多样性,在前缀评估下实现相当的ASR,但在语义判断下其效益有限。总体而言,这些发现揭示了GCG的可扩展性限制,暴露了推理任务中被忽视的漏洞,并激励进一步开发基于退火的策略,以实现更稳健的对抗评估。
引用
@article{arxiv.2509.00391,
title = {The Resurgence of GCG Adversarial Attacks on Large Language Models},
author = {Yuting Tan and Xuying Li and Zhuo Li and Huizhen Shu and Peikang Hu},
journal= {arXiv preprint arXiv:2509.00391},
year = {2025}
}
备注
12 pages, 5 figures