中文

面向 LLMs 的对抗训练中的分布差距问题

机器学习 2026-02-19 v2 人工智能 密码学与安全

摘要

LLM 的对抗训练是提高其对抗性鲁棒性的最具前景的方法之一。然而,尽管取得了显著进展,模型仍然对简单的 in-distribution 探索脆弱,例如将提示改写为过去时态或翻译成其他语言。我们认为,这种持久的脆弱性源于当前对抗训练算法的根本性局限:它们仅在训练集上最小化对抗 loss,而不充分覆盖数据分布,导致模型对看似简单的数据攻击仍然脆弱。为弥合这一差距,我们提出 Distributional Adversarial Training (DAT)。我们利用 Diffusion LLM 近似提示和响应的真实联合分布,从而生成多样且高似然性的样本,以解决泛化失效问题。通过将由扩散模型提供的数据分布优化与持续对抗训练相结合,DAT 相较于先前方法实现了显著提升的对抗鲁棒性。

关键词

引用

@article{arxiv.2602.15238,
  title  = {Closing the Distribution Gap in Adversarial Training for LLMs},
  author = {Chengzhi Hu and Jonas Dornbusch and David Lüdke and Stephan Günnemann and Leo Schwinn},
  journal= {arXiv preprint arXiv:2602.15238},
  year   = {2026}
}