超越后缀:GCG 对抗攻击中词元位置的影响
机器学习
2026-05-04 v2
摘要
大型语言模型(LLM)已在多个领域广泛采用,亟需构建鲁棒的安全对齐机制。然而,由于能够通过对抗性提示绕过对齐的越狱攻击,鲁棒性仍然面临挑战。本文聚焦于常见的贪心坐标梯度(GCG)攻击,识别了在通常以后缀形式化的越狱攻击中所未被充分探索的攻击角度:对抗性词元在提示中位置的放置。以 GCG 为案例,我们表明,优化生成前缀而非后缀,以及在评估过程中变化对抗性词元位置,均显著影响攻击成功率。我们的发现凸显了当前安全评估中的一个关键盲点,强调在 LLM 对抗鲁棒性评估中需考虑对抗性词元的位置。
引用
@article{arxiv.2602.03265,
title = {Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models},
author = {Hicham Eddoubi and Umar Faruk Abdullahi and Fadi Hassan},
journal= {arXiv preprint arXiv:2602.03265},
year = {2026}
}
备注
12 pages, 10 figures, presented at the "I Can't Believe It's Not Better" workshop at ICLR 2026