中文

MacPrompt:马卡龙蒙导引的文本到图像模型攻击

密码学与安全 2026-01-13 v1

摘要

文本到图像 (T2I) 模型因其生成 NSFW 和其他被禁内容的能力而引起日益增加的安全关注。为缓解这些风险,已引入安全过滤器和概念移除技术,以阻止不当提示或从模型中擦除敏感概念。然而,所有现有的防御方法都不太成熟,难以处理多样化的对抗提示。在本工作中,我们引入 MacPrompt,这是一种新的黑盒且跨语言的攻击,揭示了 T2I 安全机制以前所未察觉的漏洞。与依赖同义词替换或提示混淆的现有攻击不同,MacPrompt 通过对有害术语进行跨语言字符级重组来构造马卡龙式对抗提示,从而实现对语义和外观的细粒度控制。凭借这一设计,MacPrompt 制造了与原始有害输入高度语义相似的提示(最高可达 0.96),同时绕过主要安全过滤器(最高可达 100%)。更关键的是,它对于与性相关内容的攻击成功率可达 92%,对于暴力内容的攻击成功率可达 90%,有效地甚至打破了最先进的概念移除防御。这些结果凸显了针对语言多样性和细粒度对抗策略需要重新评估现有 T2I 安全机制鲁活性的迫切需求。

关键词

引用

@article{arxiv.2601.07141,
  title  = {MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models},
  author = {Xi Ye and Yiwen Liu and Lina Wang and Run Wang and Geying Yang and Yufei Hou and Jiayi Yu},
  journal= {arXiv preprint arXiv:2601.07141},
  year   = {2026}
}

备注

Accepted by AAAI 2026