面向 LLMs 的对抗训练中的分布差距问题
机器学习
2026-02-19 v2 人工智能
密码学与安全
摘要
LLM 的对抗训练是提高其对抗性鲁棒性的最具前景的方法之一。然而,尽管取得了显著进展,模型仍然对简单的 in-distribution 探索脆弱,例如将提示改写为过去时态或翻译成其他语言。我们认为,这种持久的脆弱性源于当前对抗训练算法的根本性局限:它们仅在训练集上最小化对抗 loss,而不充分覆盖数据分布,导致模型对看似简单的数据攻击仍然脆弱。为弥合这一差距,我们提出 Distributional Adversarial Training (DAT)。我们利用 Diffusion LLM 近似提示和响应的真实联合分布,从而生成多样且高似然性的样本,以解决泛化失效问题。通过将由扩散模型提供的数据分布优化与持续对抗训练相结合,DAT 相较于先前方法实现了显著提升的对抗鲁棒性。
引用
@article{arxiv.2602.15238,
title = {Closing the Distribution Gap in Adversarial Training for LLMs},
author = {Chengzhi Hu and Jonas Dornbusch and David Lüdke and Stephan Günnemann and Leo Schwinn},
journal= {arXiv preprint arXiv:2602.15238},
year = {2026}
}