中文

Erased but Exploitable:黑盒嵌入感知的对抗性提示攻击

计算机视觉与模式识别 2026-05-27 v1 人工智能

摘要

机器学习消除旨在从预训练的文本到图像扩散模型中移除特定概念,然而已有若干白盒和黑盒攻击被引入以使模型能够生成此类未被消除的概念。这些攻击然而不符合现实威胁模型:要么假设访问模型权重,要么导致产生难以被检测的胶囊对抗提示。本文旨在弥补这一差距。我们引入BEAP(Black-box Embedding-Aware Prompting),一种黑盒、嵌入感知的对抗性提示攻击,利用大型语言模型(LLM)迭代生成有效的对抗提示并利用其隐藏漏洞。BEAP在文本空间中执行嵌入感知搜索,结合多个奖励信号:未被消除概念的存在、文本-图像对齐以及图像质量,以细化生成的提示。与以往攻击方法不同,BEAP保持提示对安全过滤器不可检测,同时生成高质量图像。大量实验表明,BEAP相对于先前方法将攻击成功率(ASR)提高了60%以上,平均仅需十五个提示即可成功攻击。警告:本文包含可能令人 offense 或困扰的模型输出。

关键词

引用

@article{arxiv.2605.26332,
  title  = {Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models},
  author = {Arian Komaei Koma and Seyed Amir Kasaei and AmirMahdi Sadeghzadeh and Mohammad Hossein Rohban},
  journal= {arXiv preprint arXiv:2605.26332},
  year   = {2026}
}