中文

扩散模型的元取消学习:防止重新学习已取消的概念

太阳与恒星天体物理 2024-10-17 v1 星系天体物理

摘要

随着基于扩散的图像生成技术的快速发展,正在大力致力于从预训练扩散模型(DM)中取消学习有害或受版权保护的概念,以防止潜在的模型滥用。然而,人们注意到,即使在发布前正确取消学习DM,恶意微调仍可能削弱这一过程,导致DM重新学习已取消的概念。这部分原因是某些良性概念(例如“皮肤”)保留在DM中与已取消的概念(例如“裸露”)相关,从而通过微调促进其重新学习。为此,我们提出了在DM上进行元取消学习。直观地说,经过元取消学习的DM在原样使用时应表现像已取消学习的DM;此外,如果该元取消学习的DM对已取消的概念进行恶意微调, 则保留其中的相关良性概念将被触发自毁,从而阻碍已取消概念的重新学习。我们的元取消学习框架与大多数现有取消学习方法兼容,仅需添加一个易于实现的元目标。我们通过在Stable Diffusion模型(SD-v1-4和SDXL)上进行概念取消学习的实证实验进行了验证,并通过大量消融研究进行了支持。我们的代码可在 https://github.com/sail-sg/Meta-Unlearning 查看。

关键词

引用

@article{arxiv.2410.12776,
  title  = {The Nature of a Recently Discovered Wolf-Rayet Binary: Archetype of Stripping?},
  author = {Philip Massey and Kathryn F. Neugent and Nidia I. Morrell and Desmond John Hillier and Laura R. Penny},
  journal= {arXiv preprint arXiv:2410.12776},
  year   = {2024}
}

备注

Accepted for publication in the Astrophysical Journal