中文

末层隐藏层激活在对抗鲁棒性上出奇的有效性

机器学习 2022-05-17 v2 人工智能

摘要

在基于标准深度神经网络(DNN)的分类器中,通常惯例是省略最后(输出)层的激活函数,并直接对logits应用softmax函数以得到每一类的概率分数。在这类架构中,分类器对任意输出类的损失值与该最终概率分数和相应类的标签值之差成正比。标准的白盒对抗规避攻击,无论是有目标还是无目标,主要试图利用模型损失函数的梯度来制造对抗样本并欺骗模型。在本研究中,我们从数学和实验两方面表明,在模型的输出层使用一些广为人知的激活函数并配合高温度值,对于有无目标攻击情形均有将梯度置零的效果,从而阻止攻击者利用模型的损失函数制造对抗样本。我们已在MNIST(数字)、CIFAR10数据集上通过实验验证了方法的有效性。详细实验证实,我们的方法显著提升了针对基于梯度的有目标和无目标攻击威胁的鲁棒性。并且,我们展示了输出层增强的非线性对一些其他攻击方法(如Deepfool攻击)也具有额外益处。

关键词

引用

@article{arxiv.2202.07342,
  title  = {Unreasonable Effectiveness of Last Hidden Layer Activations for Adversarial Robustness},
  author = {Omer Faruk Tuna and Ferhat Ozgur Catak and M. Taner Eskil},
  journal= {arXiv preprint arXiv:2202.07342},
  year   = {2022}
}

备注

IEEE COMPSAC 2022 publication full version