结合对抗训练的防御性遗忘:扩散模型中鲁棒的概念擦除
计算机视觉与模式识别
2024-10-10 v3 密码学与安全
摘要
扩散模型(DM)在文本到图像生成方面取得了显著成功,但也带来了安全风险,例如可能生成有害内容和侵犯版权。机器遗忘技术(也称为概念擦除)已被开发用于应对这些风险。然而,这些技术仍然容易受到对抗性提示攻击,这种攻击可以促使遗忘后的DM重新生成包含本应擦除的概念(如裸体)的不期望图像。本文旨在通过将对抗训练(AT)原理融入机器遗忘来增强概念擦除的鲁棒性,从而形成鲁棒的遗忘框架AdvUnlearn。然而,有效且高效地实现这一点极具挑战性。首先,我们发现直接实施AT会损害遗忘后DM的图像生成质量。为解决此问题,我们在额外的保留集上开发了一种保持效用的正则化,优化了AdvUnlearn中概念擦除鲁棒性与模型效用之间的权衡。此外,我们确定文本编码器是比UNet更适合进行鲁棒化的模块,从而确保遗忘有效性。并且获得的文本编码器可以作为即插即用的鲁棒遗忘器用于各种DM类型。实验上,我们进行了大量实验,展示了AdvUnlearn在各种DM遗忘场景(包括裸体、物体和风格概念的擦除)中的鲁棒性优势。除了鲁棒性,AdvUnlearn还实现了与模型效用的平衡权衡。据我们所知,这是首个通过AT系统探索鲁棒DM遗忘的工作,与现有忽视概念擦除鲁棒性的方法截然不同。代码可在https://github.com/OPTML-Group/AdvUnlearn获取。
引用
@article{arxiv.2405.15234,
title = {Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models},
author = {Yimeng Zhang and Xin Chen and Jinghan Jia and Yihua Zhang and Chongyu Fan and Jiancheng Liu and Mingyi Hong and Ke Ding and Sijia Liu},
journal= {arXiv preprint arXiv:2405.15234},
year = {2024}
}
备注
Accepted by NeurIPS'24. Codes are available at https://github.com/OPTML-Group/AdvUnlearn