中文

Stable Diffusion并不稳定

计算机视觉与模式识别 2023-06-07 v2

摘要

近年来,文本到图像模型蓬勃发展。尽管它们具有强大的生成能力,我们的研究发现了该生成过程缺乏鲁棒性。具体而言,对文本提示引入微小扰动会导致生成图像中主体对象与其他类别混合或完全消失。本文中,我们提出了文本到图像模型自动攻击方法(ATM),一种基于梯度的攻击方法,以有效且高效地生成此类扰动。通过学习Gumbel Softmax分布,我们使词替换或扩展的离散过程连续化,从而确保扰动生成的可微性。一旦分布学习完成,ATM可同时采样多个攻击样本。这些攻击样本能够阻止生成模型生成期望的主体而不损害图像质量。ATM在短文本攻击中达到了91.1%的成功率,在长文本攻击中达到了81.2%的成功率。进一步的实证分析基于以下四点揭示了四种攻击模式:1)生成速度的可变性,2)粗粒度特征的相似性,3)词语的一词多义,4)词语的位置。

关键词

引用

@article{arxiv.2306.02583,
  title  = {Stable Diffusion is Unstable},
  author = {Chengbin Du and Yanxi Li and Zhongwei Qiu and Chang Xu},
  journal= {arXiv preprint arXiv:2306.02583},
  year   = {2023}
}

备注

22 pages, 20 figures