中文

通过深度神经网络响应面与不确定性区域理解对抗样本

机器学习 2021-07-02 v1

摘要

深度神经网络(DNN)是在许多系统中处理图像分类、目标识别、自然语言处理等复杂任务的流行模型。因此DNN的结构性漏洞成为这些系统中安全漏洞的一部分。本文研究DNN对抗样本的根本原因。我们考察DNN响应面以理解其分类边界。我们的研究揭示了导致对抗样本的DNN分类边界的结构性问题。现有攻击算法给定一张干净图像可生成从几个到几百个对抗样本。我们展示给定一张干净样本存在无穷多个对抗图像,全部位于该干净样本的小邻域内。我们随后定义DNN不确定性区域,并展示对抗样本的可迁移性并非普遍的。我们还论证泛化误差——为DNN建立的大样本理论保证——不能充分刻画对抗样本现象。我们需要新理论来衡量DNN鲁棒性。

关键词

引用

@article{arxiv.2107.00003,
  title  = {Understanding Adversarial Examples Through Deep Neural Network's Response Surface and Uncertainty Regions},
  author = {Juan Shu and Bowei Xi and Charles Kamhoua},
  journal= {arXiv preprint arXiv:2107.00003},
  year   = {2021}
}