中文

生成与否?安全驱动的遗忘扩散模型至今仍易生成不安全图像

计算机视觉与模式识别 2024-07-09 v4

摘要

扩散模型(DMs)近期的进展革新了逼真且复杂图像的生成。然而,这些模型也带来了潜在的安全隐患,例如生成有害内容与侵犯数据版权。尽管已开发安全驱动的遗忘技术以应对这些挑战,人们对其有效性的疑虑犹存。为解决此问题,我们引入了一种评估框架,利用对抗提示来辨识这些安全驱动 DMs 在遗忘有害概念后的可信度。具体而言,我们研究了 DMs 在消除不需要的概念、风格和对象时由对抗提示所衡量的对抗鲁棒性。我们为 DMs 开发了一种高效且有效的对抗提示生成方法,称为 UnlearnDiffAtk。该方法利用 DMs 固有的分类能力来简化对抗提示的创建,从而无需辅助分类或扩散模型。通过广泛基准测试,我们评估了广泛应用的安全驱动遗忘 DMs(即遗忘不良概念、风格或对象后的 DMs)在多种任务上的鲁棒性。我们的结果证明了 UnlearnDiffAtk 相较最先进对抗提示生成方法在有效性与效率上的优势,并揭示了当前安全驱动遗忘技术应用于 DMs 时缺乏鲁棒性。代码见 https://github.com/OPTML-Group/Diffusion-MU-Attack。警告:存在可能令人不适的 AI 生成内容。

关键词

引用

@article{arxiv.2310.11868,
  title  = {To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For Now},
  author = {Yimeng Zhang and Jinghan Jia and Xin Chen and Aochuan Chen and Yihua Zhang and Jiancheng Liu and Ke Ding and Sijia Liu},
  journal= {arXiv preprint arXiv:2310.11868},
  year   = {2024}
}

备注

Accepted by ECCV'24. Codes are available at https://github.com/OPTML-Group/Diffusion-MU-Attack