中文

利用 LLM 攻击受 LLM 保护的文本到图像模型

人工智能 2024-11-27 v4

摘要

为了防止文本到图像(T2I)模型生成不道德的图像,人们部署了安全过滤器来拦截不当的绘图提示。先前的工作采用词元替换来搜索试图绕过这些过滤器的对抗性提示,但由于无意义的词元无法通过语义逻辑检查,这些方法已变得无效。在本文中,我们从不同的视角处理对抗性提示。我们证明,将绘图意图改写为多个关于单个视觉组件的良性描述,可以获得有效的对抗性提示。我们提出了一种由 LLM 驱动的多智能体方法,命名为 DACA,以自动完成意图改写。我们的方法成功绕过了 DALL-E 3 和 Midjourney 的安全过滤器并生成了目标图像,在一次性攻击中的成功率分别高达 76.7% 和 64%,在重用攻击中的成功率分别为 98% 和 84%。我们在 [此链接](https://github.com/researchcode003/DACA) 开源了我们的代码和数据集。

关键词

引用

@article{arxiv.2312.07130,
  title  = {Harnessing LLM to Attack LLM-Guarded Text-to-Image Models},
  author = {Yimo Deng and Huangxun Chen},
  journal= {arXiv preprint arXiv:2312.07130},
  year   = {2024}
}

备注

10 pages, 7 figures, under review