中文

通过限制深度神经网络隐空间实现对抗防御

计算机视觉与模式识别 2019-07-30 v4 机器学习

摘要

深度神经网络易受对抗攻击,攻击者可通过对输入图像添加微小扰动来欺骗网络。现有防御方法的鲁棒性在白盒攻击设定下大幅下降,此时 adversary 完全掌握网络信息并可迭代多次以找到强扰动。我们观察到,此类扰动存在的主要原因是所学特征空间中不同类别样本彼此邻近,这使得在输入中添加难以察觉的扰动即可彻底改变模型决策。为此,我们提出对深度网络的中间特征表示按类别解耦。具体而言,我们迫使每一类的特征位于一个凸多胞形内,且该多胞形与其他类的多胞形最大化分离。以此方式,网络被迫为每一类学习 distinct 且 distant 的决策区域。我们观察到,这一对特征的简单约束极大提升了所学模型的鲁棒性,即便面对最强的白盒攻击亦如此,且不降低在干净图像上的分类性能。我们在黑盒与白盒攻击场景下进行了广泛评估,并显示相较 SOTA 防御方法有显著增益。

关键词

引用

@article{arxiv.1904.00887,
  title  = {Adversarial Defense by Restricting the Hidden Space of Deep Neural Networks},
  author = {Aamir Mustafa and Salman Khan and Munawar Hayat and Roland Goecke and Jianbing Shen and Ling Shao},
  journal= {arXiv preprint arXiv:1904.00887},
  year   = {2019}
}

备注

Accepted at ICCV 2019