中文

贝叶斯深度学习视角下的对抗现象

机器学习 2017-11-23 v1 机器学习

摘要

深度学习模型易受对抗样本的攻击,即通过对图像施加刻意且难以察觉的扰动,使模型以高置信度误分类。然而,类别置信度本身是不确定性的不完整刻画。因此我们采用有原则的贝叶斯方法,捕捉预测中对对抗误分类的模型不确定性。我们提供了对不同贝叶斯神经网络在白盒与黑盒设置下受攻击的广泛研究,比较了网络在噪声、攻击与干净测试数据下的行为。我们观察到贝叶斯神经网络对对抗扰动在其预测中是不确定的,该行为与随机高斯扰动下观察到的行为相似。由此我们得出结论,贝叶斯神经网络可考虑用于检测对抗样本。

关键词

引用

@article{arxiv.1711.08244,
  title  = {Adversarial Phenomenon in the Eyes of Bayesian Deep Learning},
  author = {Ambrish Rawat and Martin Wistuba and Maria-Irina Nicolae},
  journal= {arXiv preprint arXiv:1711.08244},
  year   = {2017}
}

备注

13 pages, 7 figures