SC-Pro:防御不安全图像合成攻击的训练-free 框架
计算机视觉与模式识别
2025-05-28 v2
摘要
随着扩散模型的进步,图像生成性能取得了显著提升。这引发了担忧,例如滥用图像生成以创建包含裸露或暴力内容的图像,通常称为 Not Safe For Work(NSFW)内容。为此,稳定扩散模型包含几个安全检查器,用于审查初始文本提示和来自模型生成的最终输出图像。然而,最近的研究表明,这些安全检查器对对抗性攻击存在漏洞,允许生成 NSFW 图像。在本文中,我们发现这些对抗性攻击对小的文本提示或输入潜在变量的微小变化并不稳健。基于此,我们提出了 SC-Pro(球形或圆形探针),一个 training-free 框架,可轻松防御生成 NSFW 图像的对抗性攻击。此外,我们开发了一种方法,可用于高效 NSFW 检测(SC-Pro-o),进一步减少计算资源。我们在性能和适用性方面展示了我们方法的优越性。
引用
@article{arxiv.2501.05359,
title = {SC-Pro: Training-Free Framework for Defending Unsafe Image Synthesis Attack},
author = {Junha Park and Jaehui Hwang and Ian Ryu and Hyungkeun Park and Jiyoon Kim and Jong-Seok Lee},
journal= {arXiv preprint arXiv:2501.05359},
year = {2025}
}