短长度对抗训练有助于大语言模型防御长长度越狱攻击:理论与实证证据
机器学习
2026-02-03 v3 密码学与安全
机器学习
摘要
针对大语言模型(LLM)的越狱攻击旨在通过精心设计的对抗性提示,诱导LLM产生有害行为。为缓解攻击,一种方法是执行基于对抗训练(AT)的对齐,即在一些最具对抗性的提示上训练LLM,以帮助它们学习如何在攻击下安全地行为。在AT过程中,对抗性提示的长度对对齐后LLM的鲁棒性起着关键作用。虽然AT期间使用长长度对抗性提示可能导致强大的LLM鲁棒性,但其合成过程非常消耗资源,这可能限制LLM对抗训练的应用。本文聚焦于对抗性后缀越狱攻击,并揭示出,要防御对抗性后缀长度为的越狱攻击,只需在对抗性后缀长度为的提示上对齐LLM就足够了。理论上,我们分析了线性Transformer在线性回归任务上的对抗性上下文学习,并证明了训练后Transformer的鲁棒泛化界。该界依赖于项,其中和分别是训练和测试期间对抗性扰动上下文样本的数量。实证上,我们在流行的开源LLM上进行对抗训练,并评估它们对不同对抗性后缀长度的越狱攻击的鲁棒性。结果证实,攻击成功率与越狱时对抗性后缀长度的平方根与对抗训练时长度之比呈正相关。我们的发现表明,通过高效的“短长度”对抗训练来防御“长长度”越狱攻击是可行的。代码可在https://github.com/fshp971/adv-icl获取。
引用
@article{arxiv.2502.04204,
title = {Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence},
author = {Shaopeng Fu and Liang Ding and Jingfeng Zhang and Di Wang},
journal= {arXiv preprint arXiv:2502.04204},
year = {2026}
}
备注
The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)