MMA-Diffusion:面向扩散模型的多模态攻击
密码学与安全
2024-04-02 v4 计算机视觉与模式识别
摘要
近年来,文本到图像(T2I)模型取得显著进展并得到广泛采用。然而,这一进步无意中为潜在滥用开辟了途径,尤其在生成不适当或不宜工作场所(NSFW)内容方面。我们的工作引入MMA-Diffusion,一个通过有效规避开源模型与商业在线服务中当前防御措施,对T2I模型安全构成重大且现实威胁的框架。与先前方法不同,MMA-Diffusion利用文本与视觉两种模态绕过提示过滤器与事后安全检查器等防护,从而暴露并凸显现有防御机制的漏洞。
引用
@article{arxiv.2311.17516,
title = {MMA-Diffusion: MultiModal Attack on Diffusion Models},
author = {Yijun Yang and Ruiyuan Gao and Xiaosen Wang and Tsung-Yi Ho and Nan Xu and Qiang Xu},
journal= {arXiv preprint arXiv:2311.17516},
year = {2024}
}
备注
CVPR 2024. Our codes and benchmarks are available at https://github.com/cure-lab/MMA-Diffusion