中文

面向扩散LLM的GCG攻击

机器学习 2026-01-22 v1 计算与语言 密码学与安全

摘要

虽然大多数LLM是自回归式的,但近期涌现出扩散式LLM作为生成的另一种方法。针对自回归模型的贪心坐标梯度(GCG)攻击已被证明有效,但其对扩散语言模型的适用性仍鲜有探讨。本文对GCG风格对抗性提示攻击在LLaDA(Large Language Diffusion with mAsking)上的适用性进行了探索性研究。我们评估了包括前缀扰动和后缀式对抗生成等多种攻击变体,对来自AdvBench数据集的有害提示进行测试。我们的研究为扩散语言模型的鲁棒性和攻击面提供了初始见解,并为该领域的对抗分析发展出替代的优化和评估策略提供了动力。

关键词

引用

@article{arxiv.2601.14266,
  title  = {GCG Attack On A Diffusion LLM},
  author = {Ruben Neyroud and Sam Corley},
  journal= {arXiv preprint arXiv:2601.14266},
  year   = {2026}
}