中文

利用空类限制决策空间以防御神经网络对抗攻击

计算机视觉与模式识别 2020-02-25 v1 机器学习

摘要

尽管近期取得了进展,深度神经网络通常仍易受所谓对抗样本的攻击——即带有微小扰动、可导致输出分类改变而人类观察者认为语义未变的输入图像。即便对于 MNIST 数字分类任务这类看似简单的挑战也是如此。这在一定程度上表明,这些网络并未依赖人类用于分类的同一组对象特征。本文考察了造成该现象的一个额外且很大程度上未被探索的原因——即常规训练范式将整个输入空间划分给各个训练类别。由于该范式,单个类别所学得的决策空间横跨输入空间中过大的区域,并包含了与训练集中图像无语义相似性的图像。在本研究中,我们训练包含空类(null class)的模型。即模型可“选择退出”将输入图像分类为某一数字类别。训练期间,通过多种方法创建空图像,试图为数字类别建立更紧凑且语义上更有意义的决策空间。性能最佳的模型将近乎所有对抗样本分类为空类,而非误判为错误的数字类别成员,同时在未受扰动的测试集上保持高准确率。本文提出的空类使用及训练范式可为某些应用提供有效的对抗攻击防御。复现本研究的代码将发布于 https://github.com/mattroos/null_class_adversarial_defense 。

关键词

引用

@article{arxiv.2002.10084,
  title  = {Utilizing a null class to restrict decision spaces and defend against neural network adversarial attacks},
  author = {Matthew J. Roos},
  journal= {arXiv preprint arXiv:2002.10084},
  year   = {2020}
}

备注

15 pages, 19 figures