统一文本到图像生成模型的提示攻击
计算机视觉与模式识别
2025-02-25 v1
摘要
文本到图像(T2I)模型取得了显著进展,但其日益流行的使用引发了安全隐忧,因其可能生成有害图像。为此,我们提出UPAM(Unified Prompt Attack),一个新框架,从攻击视角评估T2I模型的鲁棒性。与专注于文本防御的先前方法不同,UPAM统一了对文本和视觉防御的攻击。此外,它实现了梯度优化,克服了依赖枚举的局限,提高了效率和效果。为处理T2I模型因防御而阻止图像输出的情况,我们引入球形探测学习(SPL),即使没有图像结果也能实现优化。遵循SPL后,我们的模型能够绕过防御,诱导生成有害内容。为确保攻击意图与语义对齐,我们提出语义增强学习(SEL),实现精确的语义控制。UPAM还通过基于情境的自然性增强(INE)优先考虑对抗提示的自然性,使其更难被人类审查者检测到。此外,我们针对先前方法中常见的迭代查询问题——这在API防御者容易检测到的情形——引入可迁移攻击学习(TAL),实现以最小查询次数进行有效攻击。广泛的实验验证表明,UPAM在有效性、效率、自然性和低查询检测率方面均优于先前方法。
引用
@article{arxiv.2502.16423,
title = {Unified Prompt Attack Against Text-to-Image Generation Models},
author = {Duo Peng and Qiuhong Ke and Mark He Huang and Ping Hu and Jun Liu},
journal= {arXiv preprint arXiv:2502.16423},
year = {2025}
}
备注
Accepted by IEEE T-PAMI 2025