一种可解释的深度神经网络对抗鲁棒性度量
密码学与安全
2018-06-07 v2 机器学习
机器学习
摘要
深度神经网络(DNN)通过在各种视觉任务中取得最先进性能,极大地推动了计算机视觉领域的发展。这些成果不仅限于视觉领域,在语音识别与机器翻译任务中亦可见到。近来,人们发现当使用对原始输入图像做难以察觉的改动所构造的样本进行测试时,DNN会严重失效。这造成了DNN验证性能与对抗性能之间的差距。文献中仍缺乏一种有效且可泛化的鲁棒性度量来评估DNN在这些对抗输入上的表现。本文中,我们提出噪声敏感度分数(NSS),一种在不同形式的固定方向攻击下量化DNN对特定输入性能的度量。我们提供了深入的数学解释以透彻理解所提度量。借助NSS,我们还提出了一种基于偏度的数据集鲁棒性度量,用于评估DNN在给定数据集上的对抗性能。我们使用广泛使用的先进架构以及流行分类数据集(如MNIST、CIFAR-10、CIFAR-100和ImageNet)进行了大量实验,以验证所提度量的有效性与泛化性。与以往工作仅在输入域简单测量DNN对抗鲁棒性不同,所提NSS建立在对抗攻击的深入数学理解之上,并给出了更明确的鲁棒性解释。
引用
@article{arxiv.1806.01477,
title = {An Explainable Adversarial Robustness Metric for Deep Learning Neural Networks},
author = {Chirag Agarwal and Bo Dong and Dan Schonfeld and Anthony Hoogs},
journal= {arXiv preprint arXiv:1806.01477},
year = {2018}
}