中文

PLA:针对文本到图像生成模型的提示学习攻击

密码学与安全 2025-08-07 v1 人工智能 计算机视觉与模式识别

摘要

文本到图像(T2I)模型已在 various 应用中广泛采用。尽管取得了显著成功,但 T2I 模型的潜在滥用构成了生成不适合工作(NSFW)内容的重大风险。为调查 T2I 模型的脆弱性,本文探索了在黑箱环境下通过对抗攻击绕过安全机制的方法。大多数先前方法依赖词汇替换来搜索对抗性提示,由于搜索空间受限,导致性能远不如基于梯度的训练。然而,黑箱环境为训练梯度驱动的攻击方法带来了独特的挑战,因为无法获取 T2I 模型的内部架构和参数。为促进黑箱环境下对抗性提示的学习,我们提出了一种新型提示学习攻击框架(PLA),通过利用多模态相似性设计针对黑箱 T2I 模型的洞见导向梯度训练。实验表明,我们的新方法在成功率上显著优于最先进方法,能够有效攻击包括提示过滤器和事后安全检查器在内的黑箱 T2I 模型的安全机制。警告:本文可能包含冒犯性生成内容。

关键词

引用

@article{arxiv.2508.03696,
  title  = {PLA: Prompt Learning Attack against Text-to-Image Generative Models},
  author = {Xinqi Lyu and Yihao Liu and Yanjie Li and Bin Xiao},
  journal= {arXiv preprint arXiv:2508.03696},
  year   = {2025}
}

备注

10 pages, 3 figures, and published to ICCV2025