通用越狱后缀是强注意力劫持器
密码学与安全
2025-12-23 v2
摘要
我们研究了基于后缀的越狱攻击——这是一类针对大语言模型(LLM)的强大攻击方法,通过优化对抗性后缀来绕过安全对齐。以广泛使用的 GCG 攻击为基础,我们观察到后缀的有效性存在差异:某些后缀比其他后缀更具通用性——能够泛化到许多未见的有害指令。我们首先证明,一个浅层的关键机制驱动了 GCG 的有效性。该机制基于从对抗性后缀到生成前最终聊天模板令牌的信息流。量化该机制在生成过程中的主导地位,我们发现 GCG 不规则且激进地劫持了上下文化过程。关键的是,我们将劫持与通用性现象联系起来,通用性越强的后缀劫持能力越强。随后,我们证明这些洞见具有实际意义:GCG 的通用性可以在无额外计算成本的情况下高效增强(在某些情况下提升高达 ×5 倍),并且也可以进行精准缓解,在最小效用损失下至少将攻击成功率减半。我们在 http://github.com/matanbt/interp-jailbreak 发布了我们的代码和数据。
引用
@article{arxiv.2506.12880,
title = {Universal Jailbreak Suffixes Are Strong Attention Hijackers},
author = {Matan Ben-Tov and Mor Geva and Mahmood Sharif},
journal= {arXiv preprint arXiv:2506.12880},
year = {2025}
}
备注
Accepted at TACL 2026