通过深度神经网络响应面与不确定性区域理解对抗样本
机器学习
2021-07-02 v1
摘要
深度神经网络(DNN)是在许多系统中处理图像分类、目标识别、自然语言处理等复杂任务的流行模型。因此DNN的结构性漏洞成为这些系统中安全漏洞的一部分。本文研究DNN对抗样本的根本原因。我们考察DNN响应面以理解其分类边界。我们的研究揭示了导致对抗样本的DNN分类边界的结构性问题。现有攻击算法给定一张干净图像可生成从几个到几百个对抗样本。我们展示给定一张干净样本存在无穷多个对抗图像,全部位于该干净样本的小邻域内。我们随后定义DNN不确定性区域,并展示对抗样本的可迁移性并非普遍的。我们还论证泛化误差——为DNN建立的大样本理论保证——不能充分刻画对抗样本现象。我们需要新理论来衡量DNN鲁棒性。
引用
@article{arxiv.2107.00003,
title = {Understanding Adversarial Examples Through Deep Neural Network's Response Surface and Uncertainty Regions},
author = {Juan Shu and Bowei Xi and Charles Kamhoua},
journal= {arXiv preprint arXiv:2107.00003},
year = {2021}
}