PLA:针对文本到图像生成模型的提示学习攻击
密码学与安全
2025-08-07 v1 人工智能
计算机视觉与模式识别
摘要
文本到图像(T2I)模型已在 various 应用中广泛采用。尽管取得了显著成功,但 T2I 模型的潜在滥用构成了生成不适合工作(NSFW)内容的重大风险。为调查 T2I 模型的脆弱性,本文探索了在黑箱环境下通过对抗攻击绕过安全机制的方法。大多数先前方法依赖词汇替换来搜索对抗性提示,由于搜索空间受限,导致性能远不如基于梯度的训练。然而,黑箱环境为训练梯度驱动的攻击方法带来了独特的挑战,因为无法获取 T2I 模型的内部架构和参数。为促进黑箱环境下对抗性提示的学习,我们提出了一种新型提示学习攻击框架(PLA),通过利用多模态相似性设计针对黑箱 T2I 模型的洞见导向梯度训练。实验表明,我们的新方法在成功率上显著优于最先进方法,能够有效攻击包括提示过滤器和事后安全检查器在内的黑箱 T2I 模型的安全机制。警告:本文可能包含冒犯性生成内容。
引用
@article{arxiv.2508.03696,
title = {PLA: Prompt Learning Attack against Text-to-Image Generative Models},
author = {Xinqi Lyu and Yihao Liu and Yanjie Li and Bin Xiao},
journal= {arXiv preprint arXiv:2508.03696},
year = {2025}
}
备注
10 pages, 3 figures, and published to ICCV2025