通过推理时提示噪声优化保障文本到图像生成的安全性
计算机视觉与模式识别
2024-12-06 v1
摘要
文本到图像(T2I)扩散模型因能够基于文本提示生成高质量且多样化的图像而广受认可。然而,尽管近期取得了进展,这些模型仍容易生成包含敏感或不适当内容的图像,这可能对用户造成伤害。当前 efforts to prevent inappropriate image generation for diffusion models 容易被绕过且易受对抗性攻击。如何确保T2I模型与特定安全目标保持一致仍是一个重大挑战。本文提出了一种新颖且无需训练的单纯方法,称为提示噪声优化(Prompt-Noise Optimization, PNO),以缓解不安全图像生成。我们的方法引入了一种新型优化框架,利用连续提示嵌入和注入噪声轨迹在采样过程中的作用,以生成安全图像。大量数值结果表明,我们的框架在抑制有毒图像生成方面实现了最先进的性能,并对对抗性攻击表现出鲁棒性,无需调整模型参数。此外,与现有方法相比,PNO在所需的生成时间与安全生成与提示-图像对齐之间取得了最佳的权衡。
引用
@article{arxiv.2412.03876,
title = {Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization},
author = {Jiangweizhi Peng and Zhiwei Tang and Gaowen Liu and Charles Fleming and Mingyi Hong},
journal= {arXiv preprint arXiv:2412.03876},
year = {2024}
}