用于鲁棒性的雅可比对抗正则化网络
计算机视觉与模式识别
2020-01-30 v2 密码学与安全
神经与进化计算
摘要
对抗样本是通过难以察觉的扰动精心构造的,意图欺骗神经网络。面对此类攻击,对抗训练及其变体是迄今为止最强的防御手段。先前的研究指出,经过对抗训练的鲁棒模型往往比非鲁棒模型产生更具显著性和可解释性的雅可比矩阵。一个自然的问题是:以产生显著雅可比为目标训练的模型是否能带来更好的鲁棒性?本文以肯定的实证结果回答了该问题。我们提出雅可比对抗正则化网络(JARN)作为一种方法,通过对模型的雅可比进行对抗正则化使其类似于自然训练图像,从而优化分类器雅可比的显著性。在 MNIST、SVHN 和 CIFAR-10 数据集上,用 JARN 训练的图像分类器相比标准模型显示出提升的鲁棒精度,揭示了在不使用对抗训练样本的情况下提升鲁棒性的新角度。
引用
@article{arxiv.1912.10185,
title = {Jacobian Adversarially Regularized Networks for Robustness},
author = {Alvin Chan and Yi Tay and Yew Soon Ong and Jie Fu},
journal= {arXiv preprint arXiv:1912.10185},
year = {2020}
}
备注
ICLR 2020 Camera Ready