Ring-A-Bell!扩散模型的概念移除方法究竟有多可靠?
机器学习
2024-06-10 v4
摘要
用于文本到图像(text-to-image, T2I)合成的扩散模型,如Stable Diffusion (SD),近期在生成高质量内容方面展现出卓越能力。然而,这一进展引发了关于潜在滥用的诸多担忧,特别是在创建受版权保护、禁止和受限内容,或NSFW(not safe for work)图像方面。尽管已作出努力来缓解此类问题,例如在评估阶段实施安全过滤器,或通过微调模型以消除不良概念或风格,但这些安全措施在处理广泛提示时的有效性在很大程度上仍未被探索。在本工作中,我们旨在通过提出一种新颖的概念检索算法来进行评估,以研究这些安全机制。我们引入Ring-A-Bell,一种面向T2I扩散模型的模型无关红队(red-teaming)工具,其整个评估可提前准备,无需目标模型的先验知识。具体而言,Ring-A-Bell首先执行概念提取,以获得敏感和不恰当概念的整体表示。随后,利用提取的概念,Ring-A-Bell自动识别扩散模型的有问题提示并对应生成不当内容,使用户能够评估已部署安全机制的可靠性。最后,我们通过测试Midjourney等在线服务以及各种概念移除方法,对方法进行实证验证。我们的结果表明,Ring-A-Bell通过操纵安全提示基准,可将原本被视为安全的提示转化为规避现有安全机制的形式,从而揭示所谓安全机制的缺陷,这些缺陷在实践中可能导致有害内容的生成。我们的代码见 https://github.com/chiayi-hsu/Ring-A-Bell。
引用
@article{arxiv.2310.10012,
title = {Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?},
author = {Yu-Lin Tsai and Chia-Yi Hsu and Chulin Xie and Chih-Hsun Lin and Jia-You Chen and Bo Li and Pin-Yu Chen and Chia-Mu Yu and Chun-Ying Huang},
journal= {arXiv preprint arXiv:2310.10012},
year = {2024}
}
备注
This paper has already been accepted by ICLR 2024. This version is the camera-ready version