中文

基于扩散模型的语义对抗攻击

计算机视觉与模式识别 2023-09-15 v1 人工智能 密码学与安全 机器学习

摘要

传统对抗攻击侧重于通过在像素空间中添加对抗扰动来操纵干净样本。相比之下,语义对抗攻击侧重于改变干净样本的语义属性,如颜色、上下文与特征,这在现实世界中更具可行性。本文中,我们利用近期扩散模型提出一种快速生成语义对抗攻击的框架,因为语义信息包含在训练良好的扩散模型的潜空间中。该框架有两种变体:1)语义变换(ST)方法微调生成图像的潜空间和/或扩散模型本身;2)潜空间掩码(LM)方法用另一目标图像与基于局部反向传播的归因方法对潜空间进行掩码。此外,ST 方法可应用于白盒或黑盒设定。在 CelebA-HQ 与 AFHQ 数据集上进行了大量实验,与其他基线相比,我们的框架展现出极高的保真度、泛化性与可迁移性。我们的方法在多种设定下达到约 100% 的攻击成功率,最佳 FID 为 36.61。代码见 https://github.com/steven202/semantic_adv_via_dm。

关键词

引用

@article{arxiv.2309.07398,
  title  = {Semantic Adversarial Attacks via Diffusion Models},
  author = {Chenan Wang and Jinhao Duan and Chaowei Xiao and Edward Kim and Matthew Stamm and Kaidi Xu},
  journal= {arXiv preprint arXiv:2309.07398},
  year   = {2023}
}

备注

To appear in BMVC 2023