面向稳健和安全文本到图像模型的直接忘卸优化
计算机视觉与模式识别
2025-01-17 v2
摘要
最近在文本到图像(T2I)模型方面的进展已经开辟了广泛的应用范围,但也带来了显著的风险,尤其是其潜在生成不安全内容的能力。为缓解此问题,研究人员开发了忘卸技术来移除模型生成潜在有害内容的能力。然而,这些方法容易被对手攻击所绕过,对于确保生成图像的安全性而言不可靠。在本文中,我们提出了直接忘卸优化(Direct Unlearning Optimization, DUO)框架,用于从T2I模型中移除不适合工作场所(Not Safe For Work, NSFW)内容,同时保持其对无关主题的性能。DUO采用偏好优化方法,使用精心策划的配对图像数据,确保模型学习移除不安全视觉概念,同时保留无关特征。此外,我们引入一种输出保持正则化项,以维持模型在安全内容上的生成能力。广泛的实验表明,DUO能够在各种最先进的 red teaming 方法下稳健地防御,不会对无关主题的性能产生显著下降,正如 FID 和 CLIP 分数所衡量的那样。我们的工作促进了更安全、更可靠的T2I模型的开发,为其在封闭源和开源场景下的负责任部署铺平了道路。
关键词
引用
@article{arxiv.2407.21035,
title = {Direct Unlearning Optimization for Robust and Safe Text-to-Image Models},
author = {Yong-Hyun Park and Sangdoo Yun and Jin-Hwa Kim and Junho Kim and Geonhui Jang and Yonghyun Jeong and Junghyo Jo and Gayoung Lee},
journal= {arXiv preprint arXiv:2407.21035},
year = {2025}
}
备注
This paper has been accepted for NeurIPS 2024