面向扩散LLM的GCG攻击
机器学习
2026-01-22 v1 计算与语言
密码学与安全
摘要
虽然大多数LLM是自回归式的,但近期涌现出扩散式LLM作为生成的另一种方法。针对自回归模型的贪心坐标梯度(GCG)攻击已被证明有效,但其对扩散语言模型的适用性仍鲜有探讨。本文对GCG风格对抗性提示攻击在LLaDA(Large Language Diffusion with mAsking)上的适用性进行了探索性研究。我们评估了包括前缀扰动和后缀式对抗生成等多种攻击变体,对来自AdvBench数据集的有害提示进行测试。我们的研究为扩散语言模型的鲁棒性和攻击面提供了初始见解,并为该领域的对抗分析发展出替代的优化和评估策略提供了动力。
引用
@article{arxiv.2601.14266,
title = {GCG Attack On A Diffusion LLM},
author = {Ruben Neyroud and Sam Corley},
journal= {arXiv preprint arXiv:2601.14266},
year = {2026}
}