SafeGen:缓解文本到图像模型中的色情内容生成
摘要
近年来,诸如 Stable Diffusion 等文本到图像(T2I)模型在根据文本描述生成高质量图像方面展现出了卓越的性能。然而,文本到图像模型可能会被诱导生成不安全内容(NSFW),尤其是在色情场景下。现有的对策大多集中于过滤不当的输入和输出,或抑制不当的文本嵌入,这可以屏蔽色情内容(例如裸体),但仍可能容易受到对抗性提示的攻击——这些输入看似无害但意图不良。在本文中,我们提出了 SafeGen,一个以与文本无关的方式缓解文本到图像模型生成色情内容的框架。其核心思想是不管文本输入如何,从模型中消除显式的视觉表示。通过这种方式,文本到图像模型能够抵御对抗性提示,因为此类不安全的视觉表示已从模型内部被阻断。在四个数据集上进行的大量实验和大规模用户研究表明,SafeGen 在缓解色情内容生成的同时,保留了良性图像的高保真度。SafeGen 优于八种最先进的基线方法,并实现了 99.4% 的色情内容移除性能。此外,我们构建的对抗性提示基准为未来开发和评估抗 NSFW 生成方法提供了基础。
引用
@article{arxiv.2404.06666,
title = {SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models},
author = {Xinfeng Li and Yuchen Yang and Jiangyi Deng and Chen Yan and Yanjiao Chen and Xiaoyu Ji and Wenyuan Xu},
journal= {arXiv preprint arXiv:2404.06666},
year = {2024}
}
备注
Accepted by ACM CCS 2024. Please cite this paper as "Xinfeng Li, Yuchen Yang, Jiangyi Deng, Chen Yan, Yanjiao Chen, Xiaoyu Ji, Wenyuan Xu. SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models. In Proceedings of ACM Conference on Computer and Communications Security (CCS), 2024."