Dark Miner:防御文本到图像扩散模型的不良生成
计算机视觉与模式识别
2025-08-21 v3
摘要
文本到图像扩散模型因未经过滤的大规模训练数据(如色情图像和版权内容)而存在不良生成问题,因此有必要擦除不良概念。现有方法大多侧重于修改以包含目标概念的文本为条件的生成概率。然而,它们无法保证对训练阶段未见过的文本(尤其是来自恶意攻击的对抗性文本)的期望生成。本文分析了擦除任务,并指出现有方法无法保证最小化不良生成的总概率。为解决此问题,我们提出了 Dark Miner。它包含一个循环往复的三阶段过程,包括挖掘、验证和规避。该方法贪婪地挖掘具有目标概念最大生成概率的嵌入,并更有效地降低其生成。在实验中,我们评估了其在不适当内容、物体和风格概念上的性能。与先前方法相比,我们的方法取得了更好的擦除和防御效果,尤其是在多种对抗攻击下,同时保留了模型的原有生成能力。我们的代码将在 GitHub 上发布。
引用
@article{arxiv.2409.17682,
title = {Dark Miner: Defend against undesirable generation for text-to-image diffusion models},
author = {Zheling Meng and Bo Peng and Xiaochuan Jin and Yue Jiang and Wei Wang and Jing Dong and Tieniu Tan},
journal= {arXiv preprint arXiv:2409.17682},
year = {2025}
}