中文

基于潜变量扰动建模的可泛化对抗攻击

机器学习 2020-01-22 v3 密码学与安全 机器学习

摘要

对深度神经网络的对抗攻击传统上依赖于约束优化范式,即使用优化过程为给定输入样本获得单一对抗扰动。在本文中,我们将该问题构建为学习对抗扰动的分布,使我们能够在给定未扰动输入时生成多样的对抗分布。我们表明该框架是领域无关的,因为同一框架只需极小修改即可用于攻击不同输入领域。在图像、文本和图这三个不同领域中,我们的方法生成的白盒攻击成功率与现有方法相当或更优,并在图领域取得了新的SOTA。最后,我们证明我们的框架可高效地为单个给定输入生成一组多样的攻击,甚至能够以零样本方式攻击未见过的测试实例,展现出攻击泛化能力。

关键词

引用

@article{arxiv.1905.10864,
  title  = {Generalizable Adversarial Attacks with Latent Variable Perturbation Modelling},
  author = {Avishek Joey Bose and Andre Cianflone and William L. Hamilton},
  journal= {arXiv preprint arXiv:1905.10864},
  year   = {2020}
}