中文

面向稳健概念擦除的剪枝:扩散模型中的概念擦除

计算机视觉与模式识别 2024-05-28 v1

摘要

尽管生成模型在图像生成方面展现了惊人的能力,但文本到图像扩散模型容易产生不可取的输出,如 NSFW 内容和受版权保护的艺术作品。为此,近期研究聚焦于通过调整模型参数来擦除有问题的概念。然而,现有方法在稳健性方面存在主要缺陷,微调后的模型在面对精心设计的提示时常会重现不可取的输出。这揭示了当前方法的根本局限,可能增加在开放世界部署扩散模型时的风险。为此,我们定位与概念相关的神经元,发现这些神经元对对抗性提示高度敏感,因此可以在擦除时 deactivating,并在攻击下重新激活。为提高稳健性,我们引入了一种基于剪枝的概念擦除策略。该方法选择性地剪枝与擦除目标相关的关键参数,从而降低概念相关神经元的敏感性。该方法可以轻松集成到现有的概念擦除技术中,提供了对抗输入的稳健性改进。实验结果表明,我们模型在抵抗对抗性输入方面显著提升,擦除 NSFW 内容近乎提高 40%,擦除艺术风格提升 30%。

关键词

引用

@article{arxiv.2405.16534,
  title  = {Pruning for Robust Concept Erasing in Diffusion Models},
  author = {Tianyun Yang and Juan Cao and Chang Xu},
  journal= {arXiv preprint arXiv:2405.16534},
  year   = {2024}
}

备注

Under review