扩散模型的元取消学习:防止重新学习已取消的概念
太阳与恒星天体物理
2024-10-17 v1 星系天体物理
摘要
随着基于扩散的图像生成技术的快速发展,正在大力致力于从预训练扩散模型(DM)中取消学习有害或受版权保护的概念,以防止潜在的模型滥用。然而,人们注意到,即使在发布前正确取消学习DM,恶意微调仍可能削弱这一过程,导致DM重新学习已取消的概念。这部分原因是某些良性概念(例如“皮肤”)保留在DM中与已取消的概念(例如“裸露”)相关,从而通过微调促进其重新学习。为此,我们提出了在DM上进行元取消学习。直观地说,经过元取消学习的DM在原样使用时应表现像已取消学习的DM;此外,如果该元取消学习的DM对已取消的概念进行恶意微调, 则保留其中的相关良性概念将被触发自毁,从而阻碍已取消概念的重新学习。我们的元取消学习框架与大多数现有取消学习方法兼容,仅需添加一个易于实现的元目标。我们通过在Stable Diffusion模型(SD-v1-4和SDXL)上进行概念取消学习的实证实验进行了验证,并通过大量消融研究进行了支持。我们的代码可在 https://github.com/sail-sg/Meta-Unlearning 查看。
关键词
引用
@article{arxiv.2410.12776,
title = {The Nature of a Recently Discovered Wolf-Rayet Binary: Archetype of Stripping?},
author = {Philip Massey and Kathryn F. Neugent and Nidia I. Morrell and Desmond John Hillier and Laura R. Penny},
journal= {arXiv preprint arXiv:2410.12776},
year = {2024}
}
备注
Accepted for publication in the Astrophysical Journal