BSPA:探索针对图像生成器的黑盒隐蔽提示攻击
密码学与安全
2024-02-26 v1 计算与语言
计算机视觉与模式识别
摘要
超大规模图像生成器在各个领域提供了巨大的变革潜力。它允许用户通过某些黑盒 API 设计特定提示以生成逼真图像。然而,一些研究表明,图像生成器极易受到攻击,并通过人工设计的毒化文本生成不适合工作(NSFW)的内容,尤其是那些人类观察者难以察觉的内容。我们迫切需要大量通用且可迁移的提示来提高图像生成器(尤其是黑盒发布的 API)的安全性。然而,它们受限于劳动密集型的设计过程,并严重依赖给定指令的质量。为此,我们引入了一种黑盒隐蔽提示攻击(BSPA),采用检索器来模拟 API 用户的攻击。该方法能有效利用过滤分数来调整敏感词的检索空间以匹配输入提示,从而为图像生成器量身定制隐蔽提示。重要的是,这种方法与模型无关,无需访问模型的内部特征,确保了其适用于各种图像生成器。基于 BSPA,我们构建了一个自动化提示工具和一个全面的提示攻击数据集(NSFWeval)。大量实验表明,BSPA 有效地探索了各种最先进的可用黑盒模型(包括 Stable Diffusion XL、Midjourney 和 DALL-E 2/3)中的安全漏洞。此外,我们开发了一种弹性文本过滤器,并提供了有针对性的建议,以确保未来图像生成器免受提示攻击。
引用
@article{arxiv.2402.15218,
title = {BSPA: Exploring Black-box Stealthy Prompt Attacks against Image Generators},
author = {Yu Tian and Xiao Yang and Yinpeng Dong and Heming Yang and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:2402.15218},
year = {2024}
}