中文

对 Stable Diffusion 安全过滤器进行红队测试

人工智能 2022-11-11 v5 密码学与安全 计算机视觉与模式识别 计算机与社会 机器学习

摘要

Stable Diffusion 是近期发布的开源图像生成模型,可与 DALLE、Imagen 或 Parti 等专有模型相媲美。Stable Diffusion 带有一个安全过滤器,旨在防止生成露骨图像。遗憾的是,该过滤器经过混淆且文档记录很差。这使得用户难以在其应用中防止滥用,也难以理解该过滤器的局限性并加以改进。我们首先展示,很容易生成绕过安全过滤器的令人不安的内容。随后我们对过滤器进行逆向工程,发现尽管其旨在防止性内容,却忽略了暴力、血腥及其他类似令人不安的内容。基于我们的分析,我们认为未来模型发布中的安全措施应力求完全开放并有妥善文档记录,以激发社区的安全贡献。

关键词

引用

@article{arxiv.2210.04610,
  title  = {Red-Teaming the Stable Diffusion Safety Filter},
  author = {Javier Rando and Daniel Paleka and David Lindner and Lennart Heim and Florian Tramèr},
  journal= {arXiv preprint arXiv:2210.04610},
  year   = {2022}
}

备注

ML Safety Workshop NeurIPS 2022