量化对抗样本的感知失真
机器学习
2019-02-25 v1 机器学习
摘要
近期研究表明,仅允许向图像像素添加有界噪声的加性威胁模型不足以充分刻画不可感知对抗样本的空间。例如,微小的旋转和空间变换可以欺骗分类器、对人类保持不可感知,但与原始图像具有很大的加性距离。在本工作中,我们利用 LPIPS 和 SSIM 等定量感知度量来定义一种新颖的对抗攻击威胁模型。为展示量化对抗样本感知失真的价值,我们提出并采用了一个融合不同攻击风格的统一框架。我们首先证明,我们的框架生成的图像是孤立的攻击风格无法获得的。然后,我们使用由该框架生成的攻击进行对抗训练,以证明网络仅对其训练时所针对的对抗扰动类别具有鲁棒性,且组合攻击强于任一单独组成部分。最后,我们通过实验证明,与单独攻击相比,我们的组合攻击保持了相同的感知失真,但引发了远高的误分类率。
引用
@article{arxiv.1902.08265,
title = {Quantifying Perceptual Distortion of Adversarial Examples},
author = {Matt Jordan and Naren Manoj and Surbhi Goel and Alexandros G. Dimakis},
journal= {arXiv preprint arXiv:1902.08265},
year = {2019}
}
备注
18 pages, codebase/framework available at https://github.com/revbucket/mister_ed