基于DDIM度量损失的通用对抗性净化用于Stable Diffusion
计算机视觉与模式识别
2026-01-13 v1 密码学与安全
摘要
Stable Diffusion(SD)常在训练数据集包含对抗噪声时会产生质量下降的输出。对抗性净化作为一种解决方案,通过去除受污染数据中的对抗噪声来缓解这一问题。然而,现有的净化方法主要针对分类任务设计,无法针对SD特有的对抗策略进行应对,如针对VAE编码器、UNet去噪器或两者的攻击。为弥合SD安全性的这一空白,我们提出一种通用扩散对抗性净化框架UDAP,专为防御针对SD模型的对抗攻击而设计。UDAP利用干净图像和对抗图像在去噪扩散隐式模型(DDIM)反演期间的不同重建行为,以优化净化过程。通过最小化DDIM度量损失,UDAP能够有效去除对抗噪声。此外,我们引入一种动态epoch调整策略,根据重建误差调整优化迭代次数,显著提高效率而不牺牲净化质量。实验表明,UDAP对包括PID(VAE-targeted)、Anti-DreamBooth(UNet-targeted)、MIST(混合)以及抗性增强变体如Anti-Diffusion(Anti-DF)和MetaCloak在内的多种对抗方法具有稳健性。UDAP还在不同SD版本和文本提示之间具有良好的泛化能力,展示了在实际场景中的实用性。
引用
@article{arxiv.2601.07253,
title = {Universal Adversarial Purification with DDIM Metric Loss for Stable Diffusion},
author = {Li Zheng and Liangbin Xie and Jiantao Zhou and He YiMin},
journal= {arXiv preprint arXiv:2601.07253},
year = {2026}
}