面向对抗鲁棒性的01损失神经网络
机器学习
2020-08-24 v1 机器学习
摘要
受01损失总体鲁棒特性的启发,我们提出一种使用随机坐标下降训练的单隐藏层01损失神经网络,作为机器学习中抵御对抗攻击的防御手段。模型鲁棒性的一种度量是使输入变为对抗样本所需的最小扰动。这可通过Boundary Attack(Brendel等人2018)和HopSkipJump(Chen等人2019)方法近似。我们在CIFAR10基准的0类与1类二分类上,比较了01损失网络与二值化神经网络及标准sigmoid激活交叉熵损失网络(均在有/无高斯噪声下训练)的最小扰动。无论有无噪声训练,我们发现01损失网络的对抗扰动均显著大于其余三种模型。为进一步验证,我们在不同扰动阈值下对所有模型实施替代模型黑盒攻击,发现01损失网络在所有扰动下均最难被攻击。在扰动为0.125时,sigmoid激活交叉熵损失与二值化网络对对抗样本准确率几乎为0%,而01损失网络达40%。尽管01损失与二值化网络均使用符号激活,其训练算法不同,从而给出不同的鲁棒性解。最后我们将本网络与简单卷积模型在替代模型黑盒攻击下比较,发现准确率相当。我们的工作表明,01损失网络比凸损失与二值化网络更有潜力抵御黑盒对抗攻击。
引用
@article{arxiv.2008.09148,
title = {Towards adversarial robustness with 01 loss neural networks},
author = {Yunzhe Xue and Meiyan Xie and Usman Roshan},
journal= {arXiv preprint arXiv:2008.09148},
year = {2020}
}
备注
arXiv admin note: text overlap with arXiv:2006.07800