中文

SafeGen:缓解文本到图像模型中的色情内容生成

计算机视觉与模式识别 2024-10-18 v3 人工智能 计算与语言 密码学与安全

摘要

近年来,诸如 Stable Diffusion 等文本到图像(T2I)模型在根据文本描述生成高质量图像方面展现出了卓越的性能。然而,文本到图像模型可能会被诱导生成不安全内容(NSFW),尤其是在色情场景下。现有的对策大多集中于过滤不当的输入和输出,或抑制不当的文本嵌入,这可以屏蔽色情内容(例如裸体),但仍可能容易受到对抗性提示的攻击——这些输入看似无害但意图不良。在本文中,我们提出了 SafeGen,一个以与文本无关的方式缓解文本到图像模型生成色情内容的框架。其核心思想是不管文本输入如何,从模型中消除显式的视觉表示。通过这种方式,文本到图像模型能够抵御对抗性提示,因为此类不安全的视觉表示已从模型内部被阻断。在四个数据集上进行的大量实验和大规模用户研究表明,SafeGen 在缓解色情内容生成的同时,保留了良性图像的高保真度。SafeGen 优于八种最先进的基线方法,并实现了 99.4% 的色情内容移除性能。此外,我们构建的对抗性提示基准为未来开发和评估抗 NSFW 生成方法提供了基础。

关键词

引用

@article{arxiv.2404.06666,
  title  = {SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models},
  author = {Xinfeng Li and Yuchen Yang and Jiangyi Deng and Chen Yan and Yanjiao Chen and Xiaoyu Ji and Wenyuan Xu},
  journal= {arXiv preprint arXiv:2404.06666},
  year   = {2024}
}

备注

Accepted by ACM CCS 2024. Please cite this paper as "Xinfeng Li, Yuchen Yang, Jiangyi Deng, Chen Yan, Yanjiao Chen, Xiaoyu Ji, Wenyuan Xu. SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models. In Proceedings of ACM Conference on Computer and Communications Security (CCS), 2024."