中文

挣脱束缚:如何破解黑盒扩散模型中的安全护栏

计算机视觉与模式识别 2024-05-24 v2 人工智能 机器学习 神经与进化计算

摘要

深度神经网络可能被自然对抗样本利用,而这些样本不影响人类感知。当前方法通常依赖深度神经网络的白盒性质来生成这些对抗样本,或者人为地改变对抗样本相对于训练分布的分布。相比之下,我们提出了EvoSeed,一种基于进化策略的新型算法框架,用于生成照片级逼真的自然对抗样本。我们的EvoSeed框架使用辅助条件扩散模型和分类器在黑盒设置中运行。我们采用CMA-ES优化初始种子向量的搜索,该向量经条件扩散模型处理后,导致分类器模型对自然对抗样本进行错误分类。实验表明,生成的对抗图像具有很高的图像质量,引发了对绕过安全分类器生成有害内容的担忧。我们的研究为理解当前安全机制的局限性以及利用图像生成对分类器系统进行可行攻击的风险开辟了新途径。项目网站可访问:https://shashankkotyan.github.io/EvoSeed。

关键词

引用

@article{arxiv.2402.04699,
  title  = {Breaking Free: How to Hack Safety Guardrails in Black-Box Diffusion Models!},
  author = {Shashank Kotyan and Po-Yuan Mao and Pin-Yu Chen and Danilo Vasconcellos Vargas},
  journal= {arXiv preprint arXiv:2402.04699},
  year   = {2024}
}