中文

用于对抗攻击与防御的内部 Wasserstein 距离

机器学习 2023-02-22 v4 密码学与安全

摘要

深度神经网络(DNNs)已知易受对抗攻击的影响,此类攻击会触发 DNNs 的误分类,但可能为人眼难以察觉。对抗防御一直是提升 DNNs 鲁棒性的重要途径。现有攻击方法常依赖诸如 p\ell_p 距离等度量来扰动样本以构造对抗样本。然而,由于这些度量的扰动有限,可能不足以实施对抗攻击。本文中,我们提出一种新的内部 Wasserstein 距离(IWD)来捕捉两个样本的语义相似性,从而有助于获得比当前所用度量(如 p\ell_p 距离)更大的扰动。我们随后将内部 Wasserstein 距离应用于对抗攻击与防御。具体而言,我们开发了一种依赖 IWD 的新攻击方法,用于计算图像与其对抗样本之间的相似性。以此方式,我们可生成多样化且与语义相似的对抗样本,其更难被现有防御方法抵御。此外,我们设计了一种依赖 IWD 的新防御方法,以学习对未知对抗样本鲁棒的模型。我们提供了详尽的理论与实证证据来支持我们的方法。

关键词

引用

@article{arxiv.2103.07598,
  title  = {Internal Wasserstein Distance for Adversarial Attack and Defense},
  author = {Qicheng Wang and Shuhai Zhang and Jiezhang Cao and Jincheng Li and Mingkui Tan and Yang Xiang},
  journal= {arXiv preprint arXiv:2103.07598},
  year   = {2023}
}