中文

MixAT:组合连续与离散对抗训练用于 LLM

机器学习 2025-10-29 v2 人工智能

摘要

尽管近期努力旨在提升大语言模型(LLM)的安全性和对齐性,但当前针对前沿 LLM 的对抗攻击仍能持续引发有害生成。尽管对抗训练在传统机器学习模型中得到广泛研究并显示出显著提升鲁棒性,但其在 LLM 语境下的优势与局限性仍不为人知。具体而言,虽然现有的离散对抗攻击在产生有害内容方面有效,但使用具体对抗提示训练 LLM 往往计算成本高昂,导致依赖连续松弛。与此同时,尽管连续扰动在有效性和泛化能力方面表现出色,但并不总能捕捉由离散攻击所利用的完整漏洞谱。本文旨在弥合这一差距,我们提出一种新方法 MixAT,将更强大的离散攻击与更快的连续攻击结合进行训练。我们在广泛的前沿攻击方法上进行严格评估,提出 At Least One Attack Success Rate(ALO-ASR)指标以捕捉模型最坏情况的脆弱性。我们表明 MixAT 在鲁棒性(ALO-ASR < 20%)上显著优于先前防御措施(ALO-ASR > 50%),同时保持与基于连续松弛的方法相当的运行时。我们进一步在真实部署场景中分析 MixAT,探讨聊天模板、量化、低秩适配器和温度对对抗训练和评估的影响,揭示了当前方法论中的额外盲区。我们的结果表明,MixAT 的离散-连续防御在最小计算开销下提供了原则性且优越的鲁棒性-精度权衡,凸显了其构建更安全 LLM 的前景。我们在 https://github.com/insait-institute/MixAT 提供代码和模型。

关键词

引用

@article{arxiv.2505.16947,
  title  = {MixAT: Combining Continuous and Discrete Adversarial Training for LLMs},
  author = {Csaba Dékány and Stefan Balauca and Robin Staab and Dimitar I. Dimitrov and Martin Vechev},
  journal= {arXiv preprint arXiv:2505.16947},
  year   = {2025}
}

备注

Published at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)