Mask-GCG:对抗后缀中的所有 token 是否都必要用于越狱攻击?
计算与语言
2026-05-28 v2 人工智能
密码学与安全
摘要
大型语言模型(LLM)的越狱攻击已展示出各种成功的方法,攻击者通过操控模型来生成其设计旨在避免的有害响应。在这些方法中,贪心坐标梯度(GCG)已成为一种通用且有效的方法,通过优化后缀中的 token 来生成可越狱的提示。虽然已提出若干改进版 GCG,但它们都依赖固定长度的后缀。然而,这些后缀中潜在的冗余性尚未被探索。本文提出了 Mask-GCG,一种即插即用的方法,采用可学习的 token 掩码来识别后缀中关键的 token。我们的 approach 不仅提高了高影响位置 token 的更新概率,同时剔除低影响位置的 token。这一做法不仅减少了冗余,还降低了梯度空间的大小,从而降低了计算开销,缩短了实现成功攻击所需的时间。我们通过将 Mask-GCG 应用于原始 GCG 及其几种改进版进行评估。实验结果表明,后缀中大多数 token 对攻击成功都有显著贡献,而剔除少数低影响 token 既不会影响损失值,也不会损害攻击成功率,从而揭示了 LLM 提示中 token 的冗余性。我们的发现为从越狱攻击的角度开发高效且可解释的 LLM 提供了洞见。
引用
@article{arxiv.2509.06350,
title = {Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?},
author = {Junjie Mu and Zonghao Ying and Zhekui Fan and Zonglei Jing and Yaoyuan Zhang and Zhengmin Yu and Wenxin Zhang and Quanchen Zou and Xiangzheng Zhang},
journal= {arXiv preprint arXiv:2509.06350},
year = {2026}
}
备注
Accepted to ICASSP 2026