PromptSafe:面向安全文本到图像生成的门控提示调优
计算机视觉与模式识别
2025-08-15 v2
摘要
文本到图像(T2I)模型展现出惊人的生成能力,但仍易产生不适合工作(NSFW)内容,如暴力或色情图像。虽然近期的审核努力通过在输入末尾追加防御性标记实现软提示引导式调优,但这些方法往往依赖大规模精心挑选的图像文本数据集,并在推理时应用静态、通用的防御。这导致计算成本高、良性图像质量下降,且难以适应实际提示中多样化且细致入微的安全需求。为此,我们提出PromptSafe框架,集成轻量级仅文本监督软嵌入与推理时门控控制网络。不同于在高成本图像文本数据集上训练,我们首先使用LLM将不安全提示改写为语义对齐但安全的替代方案,构建高效的仅文本训练语料库。基于此,我们优化通用软提示,在扩散去噪过程中驱赶不安全嵌入并吸引安全嵌入。为避免过度压制良性提示,我们引入门控机制,根据估计的提示毒性自适应调整防御强度,从而使防御强度与提示风险相匹配,确保对有害输入提供强力保护,同时保持良性生成质量。广泛实验表明,PromptSafe在多个基准和T2I模型上实现SOTA不安全生成率(2.36%),同时保持高良性保真度。此外,PromptSafe对未见的有害类别具有强大的泛化能力,对不同扩散模型架构具有稳健的迁移能力,并在自适应对抗攻击下保持鲁棒性,凸显其在安全可扩展部署方面的实际价值。
关键词
引用
@article{arxiv.2508.01272,
title = {PromptSafe: Gated Prompt Tuning for Safe Text-to-Image Generation},
author = {Zonglei Jing and Xiao Yang and Xiaoqian Li and Siyuan Liang and Aishan Liu and Mingchuan Zhang and Xianglong Liu},
journal= {arXiv preprint arXiv:2508.01272},
year = {2025}
}