面向安全文本到图像与视频生成的无训练自适应警戒: SAFREE
计算机视觉与模式识别
2025-03-17 v2 人工智能
机器学习
摘要
近期扩散模型的进展显著提升了其生成高质量图像和视频的能力,但也增加了产生不安全内容的风险。现有基于忘却/编辑的方法用于安全生成会移除模型中有害概念,但面临多个挑战:(1)它们无法在无需训练的情况下立即移除有害概念。(2)它们的安全生成能力取决于收集的训练数据。(3)它们修改模型权重,可能损害与有毒概念无关的内容的质量。为此,我们提出了SAFREE,这是一种新颖的、无需训练的方法,用于安全的文本到图像和文本到视频生成,不会改变模型的权重。具体而言,我们检测文本嵌入空间中对应一组有害概念的子空间,并将提示嵌入引导远离该子空间,从而过滤有害内容而保留预期语义。为平衡过滤有害内容与保留安全概念之间的权衡,SAFREE包含一种新颖的自验证过滤机制,用于动态调整应用过滤嵌入时的去噪步骤。此外,我们在扩散潜在空间中包含自适应重新注意力机制,以在像素级别选择性地减弱与有害概念相关的特征的影响。最终,SAFREE确保一致的安全检查,保留了输出的忠实度、质量和安全性。SAFREE在与无训练基线相比的文本到图像生成中实现了SOTA性能,有效过滤有目标概念,同时保持高质量图像。它也在训练方法方面表现出竞争力。我们将SAFREE扩展到各种文本到图像主干网络和文本到视频任务,展示了其灵活性和可移植性。SAFREE为确保安全视觉生成提供了一种稳健且可适应的警戒手段。
引用
@article{arxiv.2410.12761,
title = {SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation},
author = {Jaehong Yoon and Shoubin Yu and Vaidehi Patil and Huaxiu Yao and Mohit Bansal},
journal= {arXiv preprint arXiv:2410.12761},
year = {2025}
}
备注
ICLR 2025; The first two authors contributed equally; Project page: https://safree-safe-t2i-t2v.github.io/