通过鼓励判别性特征提升对抗鲁棒性
密码学与安全
2019-05-09 v2 机器学习
摘要
深度神经网络(DNNs)在各种模式识别任务中取得了最先进的结果。然而,它们在分布外对抗样本(即由攻击者专门构造以使DNNs行为失常的输入)上表现不佳,令人质疑应用的安全性和可靠性。在本文中,我们通过在使用常规softmax交叉熵损失之外施加中心损失,鼓励DNN分类器学习更具判别性的特征。直观上,中心损失鼓励DNNs同时学习每类深度特征的中心,并最小化类内深度特征与其相应类中心之间的距离。我们假设,同时最小化类内特征间距离并最大化类间特征间距离将提升分类器对对抗样本的鲁棒性。我们在MNIST、CIFAR-10和CIFAR-100上基于最先进架构的结果证实了该直觉,并凸显了判别性特征的重要性。
引用
@article{arxiv.1811.00621,
title = {Improving Adversarial Robustness by Encouraging Discriminative Features},
author = {Chirag Agarwal and Anh Nguyen and Dan Schonfeld},
journal= {arXiv preprint arXiv:1811.00621},
year = {2019}
}
备注
This article corresponds to the accepted version at IEEE ICIP 2019. We will link the DOI as soon as it is available