对抗变换网络:学习生成对抗样本
神经与进化计算
2017-03-29 v1 人工智能
计算机视觉与模式识别
摘要
目前已提出多种不同的方法来生成对抗样本以攻击深度神经网络。这些方法要么直接对图像像素计算梯度,要么直接对图像像素进行优化求解。在本工作中,我们提出了一种全新的生成对抗样本的方法,该方法执行速度快且能提供极高的输出多样性。我们以自监督方式高效训练前馈神经网络,以针对目标网络或一组网络生成对抗样本。我们将此类网络称为对抗变换网络 (Adversarial Transformation Network, ATN)。ATN 被训练以生成对抗样本,这些样本在给定原始输入的情况下对分类器输出进行最小程度的修改,同时约束新分类结果以匹配对抗目标类别。我们提出了训练 ATN 的方法,并分析了其针对多种 MNIST 分类器以及最新 SOTA ImageNet 分类器 Inception ResNet v2 的攻击有效性。
引用
@article{arxiv.1703.09387,
title = {Adversarial Transformation Networks: Learning to Generate Adversarial Examples},
author = {Shumeet Baluja and Ian Fischer},
journal= {arXiv preprint arXiv:1703.09387},
year = {2017}
}