中文

ShieldDiff:通过强化学习抑制扩散模型中的色情内容生成

计算机视觉与模式识别 2024-10-10 v1

摘要

随着生成式AI的发展,文本到图像(T2I)模型能够生成各种内容。然而,生成的内容无法完全受到控制。T2I模型可能生成包含不适当内容的图像,这构成潜在风险。本工作通过优化设计良好的内容安全奖励函数,通过强化学习微调预训练扩散模型,以消除T2I模型中不适当内容的生成,同时保持生成图像的高质量。该方法利用由CLIP(对比语言-图像预训练)和裸露奖励组成的自定义奖励函数,以修剪遵循预训练模型的裸露内容,同时保持相应的语义意义在安全方面。在这种方式下,T2I模型对不安全的对抗性提示更为稳健,因为不安全的视觉表征被抑制了。在不同数据集上进行的大量实验表明,所提出的方法在缓解不安全内容生成方面有效,同时保持良好图像的高保真度以及不安全提示生成的图像。我们与五种现有SOTA方法进行比较,在色情内容移除和图像质量保留方面取得竞争成绩。就鲁棒性而言,我们的方法在SOTA黑箱攻击模型下表现优于对手。Furthermore, our constructed method can be a benchmark for anti-NSFW generation with semantically-relevant safe alignment.

关键词

引用

@article{arxiv.2410.05309,
  title  = {ShieldDiff: Suppressing Sexual Content Generation from Diffusion Models through Reinforcement Learning},
  author = {Dong Han and Salaheldin Mohamed and Yong Li},
  journal= {arXiv preprint arXiv:2410.05309},
  year   = {2024}
}

备注

9 pages, 10 figures