中文

大型语言模型的对抗性训练信息论视角

机器学习 2026-05-08 v1 人工智能 密码学与安全

摘要

大型语言模型(LLM)尽管在对齐和安全方面取得了进步,仍然对对抗性提示脆弱,常在新颖的攻击策略下表现出有害行为。虽然对抗性训练可以提高鲁棒性,但现有方法计算成本高昂且难以扩展。最近的连续对抗性训练方法,如连续对抗训练(CAT)和连续对抗偏好优化(CAPO),通过在嵌入空间中利用梯度扰动,实现了更高效和更具表达力的攻击。建立在此范式基础上,我们提出 WARDEN,这是一种用于 LLM 的分布式鲁棒对抗训练框架,通过 f 散度模糊集合动态重新权重对抗样本。该方法在经验数据分布的散度球内优化最坏情况对抗损失,自动强调更难的对抗样本。利用凸对偶公式,目标在 KL 散度下降化为对数求和形式,带有一个控制重新加权强度的动态参数。该研究导致了一类信息论目标的新类,显著降低攻击成功率,同时保持模型实用性。在多个 LLM 和攻击设置下,WARDEN 在计算和实用性成本方面与 CAT、CAPO 和 MixAT 基线相当,显著降低攻击成功率,成为一种可扩展的鲁棒对齐方法。

关键词

引用

@article{arxiv.2605.05415,
  title  = {Information Theoretic Adversarial Training of Large Language Models},
  author = {Yiwei Zhang and Jeremiah Birrell and Reza Ebrahimi and Rouzbeh Behnia and Jason Pacheco and Elisa Bertino},
  journal= {arXiv preprint arXiv:2605.05415},
  year   = {2026}
}