利用黑盒差分技术生成对抗输入
机器学习
2020-07-13 v1 密码学与安全
机器学习
摘要
神经网络(Neural Networks, NNs)已知易受对抗攻击。恶意代理通过将一个输入扰动为另一个输入来发起此类攻击,使得神经网络对这两个输入的分类结果不同。本文考虑一类特殊的对抗样本,它们不仅能像典型对抗样本那样暴露 NN 模型的弱点,还能体现两个 NN 模型之间的行为差异。我们称之为差异诱导对抗样本(difference-inducing adversarial examples, DIAEs)。具体而言,我们提出了 DAEGEN,这是首个用于对抗输入生成的黑盒差分技术。DAEGEN 以同一分类问题的两个 NN 模型作为输入,并在输出中给出一个对抗样本。所得对抗样本是一个 DIAE,因此它代表了两个 NN 模型在输入空间中的逐点差异。在算法上,DAEGEN 使用基于局部搜索的优化算法,通过迭代扰动输入以最大化两个模型对该输入预测的差异来寻找 DIAEs。我们在一系列基准数据集(如 MNIST、ImageNet 和 Driving)与 NN 模型(如 LeNet、ResNet、Dave 和 VGG)上进行了实验。实验结果令人鼓舞。首先,我们将 DAEGEN 与两种现有的白盒差分技术(DeepXplore 和 DLFuzz)比较,发现在相同设置下,DAEGEN 具有:1)有效性,即它是唯一在所有情况下都成功生成攻击的技术;2)精确性,即对抗攻击极有可能欺骗机器与人类;3)高效性,即它需要合理数量的分类查询。其次,我们通过将 simba 和 tremba 这两种最先进的黑盒对抗攻击方法改造至差分设置下,将 DAEGEN 与它们比较。实验结果表明 DAEGEN 的表现优于这两者。
引用
@article{arxiv.2007.05315,
title = {Generating Adversarial Inputs Using A Black-box Differential Technique},
author = {João Batista Pereira Matos Juúnior and Lucas Carvalho Cordeiro and Marcelo d'Amorim and Xiaowei Huang},
journal= {arXiv preprint arXiv:2007.05315},
year = {2020}
}