中文

MMA-Diffusion:面向扩散模型的多模态攻击

密码学与安全 2024-04-02 v4 计算机视觉与模式识别

摘要

近年来,文本到图像(T2I)模型取得显著进展并得到广泛采用。然而,这一进步无意中为潜在滥用开辟了途径,尤其在生成不适当或不宜工作场所(NSFW)内容方面。我们的工作引入MMA-Diffusion,一个通过有效规避开源模型与商业在线服务中当前防御措施,对T2I模型安全构成重大且现实威胁的框架。与先前方法不同,MMA-Diffusion利用文本与视觉两种模态绕过提示过滤器与事后安全检查器等防护,从而暴露并凸显现有防御机制的漏洞。

关键词

引用

@article{arxiv.2311.17516,
  title  = {MMA-Diffusion: MultiModal Attack on Diffusion Models},
  author = {Yijun Yang and Ruiyuan Gao and Xiaosen Wang and Tsung-Yi Ho and Nan Xu and Qiang Xu},
  journal= {arXiv preprint arXiv:2311.17516},
  year   = {2024}
}

备注

CVPR 2024. Our codes and benchmarks are available at https://github.com/cure-lab/MMA-Diffusion