DiffZOO:一种用于红队测试文本到图像生成模型的纯查询基黑盒攻击方法
密码学与安全
2025-02-07 v2 人工智能
计算机视觉与模式识别
摘要
当前的文本到图像(T2I)合成扩散模型引发了关于创建禁止或不适合工作(NSFW)图像的滥用问题。为此,提出了各种安全机制和红队攻击方法以增强或暴露T2I模型生成不适内容的能力。然而,许多红队攻击方法假设对文本编码器具有了解,限制了其实际应用。在本工作中,我们重新思考了在没有对T2l模型先验知识的情况下进行的纯黑盒攻击。为克服梯度不可用以及无法在离散提示空间内优化攻击的限制,我们提出了DiffZOO,该方法应用零阶优化获取梯度近似,并利用C-PRV和D-PRV在离散提示域内增强攻击提示。在多个T2I扩散模型的多个安全机制以及在线服务器上评估了本方法。在多个最先进的安全机制实验中,DiffZOO的平均攻击成功率比以往工作高出8.5%,因此其作为T2l模型实际红队工具的前景十分明确。
引用
@article{arxiv.2408.11071,
title = {DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order Optimization},
author = {Pucheng Dang and Xing Hu and Dong Li and Rui Zhang and Qi Guo and Kaidi Xu},
journal= {arXiv preprint arXiv:2408.11071},
year = {2025}
}