中文

基于情境学习理论理解与改进 LLMs 的连续对抗训练

机器学习 2026-04-15 v1 密码学与安全 机器学习

摘要

对抗训练(AT)是抵御大语言模型(LLMs)的 jailbreak 攻击的有效方法,但对 LLMs 执行 AT 成本高昂。为提高 LLMs 对抗训练的效率,近期研究提出了连续对抗训练(CAT),其在 LLMs 的连续嵌入空间中搜索对抗输入。尽管 CAT 已在实证上取得成功,但其背后的机制——即嵌入空间中的对抗扰动为何能帮助 LLMs 抵御由输入 token 空间合成的 jailbreak 提示——尚不为人所知。本文基于情境学习(ICL)理论,对 LLMs 的 CAT 进行首次理论分析。对于在情境线性回归任务上使用来自嵌入空间的对抗样本训练的线性变换器,我们证明了一个稳健的泛化界限,其与嵌入空间中的扰动半径呈负相关。这明确解释了为何 CAT 能抵御来自 LLM token 空间的 jailbreak 提示。进一步,稳健界限表明, adversarially 训练的 LLM 的鲁棒性与其嵌入矩阵的奇异值密切相关。基于此,我们提出在 CAT 的目标函数中引入额外的正则化项,该项取决于 LLM 嵌入矩阵的奇异值,以改进 LLM 的 CAT。实验在真实世界的 LLMs 上表明,我们的方法有助于 LLMs 在 jailbreak 鲁棒性与实用性之间实现更好的权衡。代码已公开于 https://github.com/fshp971/continuous-adv-icl。

关键词

引用

@article{arxiv.2604.12817,
  title  = {Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory},
  author = {Shaopeng Fu and Di Wang},
  journal= {arXiv preprint arXiv:2604.12817},
  year   = {2026}
}

备注

The Fourteenth International Conference on Learning Representations (ICLR 2026)