Unsafe Diffusion:关于从文本到图像模型生成不安全图像与仇恨梗图
计算机视觉与模式识别
2023-08-17 v2 密码学与安全
计算机与社会
机器学习
社会与信息网络
摘要
Stable Diffusion 与 DALLE2 等最先进的文本到图像模型正在变革人们的视觉内容生成方式。与此同时,社会严重关切对手如何利用此类模型生成不安全图像。本文聚焦于揭示文本到图像模型生成不安全图像与仇恨梗图的内在机制。我们首先构建由五类(色情、暴力、令人不安、仇恨、政治)组成的不安全图像类型学。随后,使用四个提示数据集评估四种先进文本到图像模型生成不安全图像的比例。我们发现这些模型会生成相当比例的不安全图像;在四个模型与四个提示数据集中,14.56% 的生成图像为不安全图像。比较四模型发现风险水平各异,Stable Diffusion 最易生成不安全内容(18.92% 的生成图像不安全)。鉴于 Stable Diffusion 更易生成不安全内容,我们评估其若被对手利用攻击特定个人或群体时生成仇恨梗图变体的潜力。我们采用 Stable Diffusion 支持的三种图像编辑方法:DreamBooth、Textual Inversion 与 SDEdit。评估显示,使用 DreamBooth 生成的图片中 24% 为仇恨梗图变体,呈现原始仇恨梗图与目标个人/群体特征;这些生成图像与真实世界收集的仇恨梗图变体相当。总体而言,我们的结果表明大规模生成不安全图像的危险迫在眉睫。我们讨论若干缓解措施,如筛选训练数据、规范提示与部署安全过滤器,并鼓励开发更好的防护工具以防止不安全生成。
引用
@article{arxiv.2305.13873,
title = {Unsafe Diffusion: On the Generation of Unsafe Images and Hateful Memes From Text-To-Image Models},
author = {Yiting Qu and Xinyue Shen and Xinlei He and Michael Backes and Savvas Zannettou and Yang Zhang},
journal= {arXiv preprint arXiv:2305.13873},
year = {2023}
}
备注
To Appear in the ACM Conference on Computer and Communications Security, November 26, 2023