通过抑制 Fisher 信息矩阵最大特征值防御对抗攻击
机器学习
2019-09-16 v1 机器学习
摘要
我们提出一种通过抑制 Fisher 信息矩阵(FIM)的最大特征值来防御对抗攻击的方案。我们的出发点是关于对抗样本成因的一种解释。基于良性样本与其对抗样本之间的差异由欧几里得范数度量,而二者在网络最后(softmax)层的分类概率密度差异可由 Kullback-Leibler(KL)散度度量这一思想,该解释表明输出差异是输入差异的二次型。若该二次型(即 FIM)的特征值较大,则即便输入差异很小,输出差异也会变大,这解释了对抗现象。这使得通过控制 FIM 的特征值来实现对抗防御成为可能。我们的解法是向原始网络的损失函数添加一项表示 FIM 迹的项,由于最大特征值受迹所界。我们使用多种常见攻击方法在典型深度神经网络(如 LeNet、VGG 和 ResNet)上,以数据集 MNIST、CIFAR-10 和 German Traffic Sign Recognition Benchmark(GTSRB)进行实验,验证了我们的防御方案。我们采用新损失函数并重新训练后的新网络具有有效且鲁棒的防御能力,因其降低了所生成对抗样本的欺骗率,并保持了原始网络的分类精度。
引用
@article{arxiv.1909.06137,
title = {Defending Against Adversarial Attacks by Suppressing the Largest Eigenvalue of Fisher Information Matrix},
author = {Chaomin Shen and Yaxin Peng and Guixu Zhang and Jinsong Fan},
journal= {arXiv preprint arXiv:1909.06137},
year = {2019}
}
备注
11 pages, 5 figures