中文

通过可逆神经网络探索对抗样本

机器学习 2020-12-25 v1 密码学与安全

摘要

对抗样本(AEs)是在原始图像中引入微小扰动从而误导深度神经网络(DNN)分类器的图像。这一安全漏洞近年来引发了大量研究,因为它会给依赖神经网络的系统带来现实世界的威胁。然而,对对抗样本特征的深入理解仍然难以实现。我们提出了一种借助近期进展实现此种理解的新途径,即可逆神经模型,其具备从输入到输出的 Lipschitz 连续映射函数。凭借将任意潜在表示反演回其对应输入图像的能力,我们可以在更深层次上研究对抗样本并解耦其潜在表示。基于这一新视角,我们提出了一种快速的潜在空间对抗样本生成方法,可加速对抗训练。此外,这一新视角还有助于新的对抗样本检测方式。

关键词

引用

@article{arxiv.2012.13111,
  title  = {Exploring Adversarial Examples via Invertible Neural Networks},
  author = {Ruqi Bai and Saurabh Bagchi and David I. Inouye},
  journal= {arXiv preprint arXiv:2012.13111},
  year   = {2020}
}