面向文本过滤器和视觉检查器的文本到图像生成模型统一提示攻击
计算机视觉与模式识别
2024-05-28 v2
摘要
文本到图像(T2I)模型因其潜在生成不适当或有害图像的能力而引发安全顾虑。本文提出UPAM,一种新型框架,从攻击视角研究T2I模型的鲁棒性。与大多数聚焦欺骗文本防御的现有攻击方法不同,UPAM旨在欺骗T2I模型中的文本和视觉防御。UPAM实现了梯度优化,相较于先前方法在有效性和效率方面具有优势。鉴于T2I模型可能因防御机制而不返回结果,我们引入Sphere-Probing Learning(SPL)方案,以支持在无结果返回时进行梯度优化。此外,我们设计了语义增强学习(SEL)方案以微调UPAM,以生成与目标对齐的图像。我们的框架还确保攻击的隐蔽性。大量实验表明UPAM在有效性和效率方面表现优异。
引用
@article{arxiv.2405.11336,
title = {UPAM: Unified Prompt Attack in Text-to-Image Generation Models Against Both Textual Filters and Visual Checkers},
author = {Duo Peng and Qiuhong Ke and Jun Liu},
journal= {arXiv preprint arXiv:2405.11336},
year = {2024}
}
备注
Accepted by ICML2024