SafeCFG: 基于动态安全引导控制有害特征的安全生成方法
计算机视觉与模式识别
2025-05-30 v2
摘要
扩散模型(DM)在文本到图像任务中展现出卓越的性能,广泛应用于实际场景。随着 classifier-free guidance(CFG)的引入,DM 生成图像的质量得到显著提升。然而,攻击者可通过操控 CFG 过程中的引导机制,生成更具危害性的图像。现有安全对齐方法虽能缓解生成有害图像的风险,但往往会牺牲干净图像的生成质量。为此,我们提出 SafeCFG,通过对 CFG 生成过程进行动态调制来适应性地控制有害特征,实现安全引导。该方法根据提示词的有害程度动态引导 CFG 生成过程,仅在有害 CFG 生成中引发显著偏差,从而实现高质量与高安全性的生成。SafeCFG 能够同时调制不同的有害 CFG 生成过程,以在保留高质量生成的同时消除有害元素。此外,SafeCFG 提供了图像有害性检测能力,使 DM 能在无需预定义干净或有害标签的情况下实现无监督安全对齐。实验结果表明,SafeCFG 生成的图像在质量与安全性方面均表现优异,无监督训练的安全 DM 也展现出良好的安全性能。
引用
@article{arxiv.2412.16039,
title = {SafeCFG: Controlling Harmful Features with Dynamic Safe Guidance for Safe Generation},
author = {Jiadong Pan and Liang Li and Hongcheng Gao and Zheng-Jun Zha and Qingming Huang and Jiebo Luo},
journal= {arXiv preprint arXiv:2412.16039},
year = {2025}
}