中文

HTS-Attack:用于越狱文本到图像模型的启发式标记搜索

计算机视觉与模式识别 2024-12-17 v3 密码学与安全

摘要

文本到图像(Text-to-Image,T2I)模型在图像生成与编辑方面取得了显著进展,但这些模型仍存在诸多潜在问题,尤其是在生成不适合工作内容(Not-Safe-For-Work, NSFW)的图像方面。加强攻击并发现此类漏洞有助于推动可靠且实用的T2I模型发展。大多数前期工作将T2I模型视为白盒系统,利用梯度优化生成对抗性提示词。然而,在实际场景中获取模型梯度往往是不可能的。此外,现有防御方法(如梯度遮蔽)旨在防止攻击者获取准确的梯度信息。虽然已探索了几种黑盒式越狱攻击,但由于离散空间优化的困难,这些攻击在越狱T2I模型方面表现有限。为此,我们提出HTS-Attack—a一种启发式标记搜索攻击方法。HTS-Attack首先进行初始化,以移除敏感标记,然后进行启发式搜索,其中高绩效候选方案会被重组和突变。这一过程生成新的候选池,并根据其有效性更新最优对抗性提示词。通过融合最优与次优候选方案,HTS-Attack可避免局部最优解,提高绕过防御的鲁棒性。大量实验验证了本方法在攻击最新提示检查器、事后图像检查器、安全训练的T2I模型以及线上商业模型方面的有效性。

关键词

引用

@article{arxiv.2408.13896,
  title  = {HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models},
  author = {Sensen Gao and Xiaojun Jia and Yihao Huang and Ranjie Duan and Jindong Gu and Yang Bai and Yang Liu and Qing Guo},
  journal= {arXiv preprint arXiv:2408.13896},
  year   = {2024}
}