中文

我错了多少?——研究对抗样本及其对高斯过程机器学习模型不确定性的影响

密码学与安全 2019-01-04 v4 机器学习 机器学习

摘要

机器学习模型易受对抗样本的攻击:即对输入样本进行微小扰动以故意导致误分类。当前针对对抗样本的防御,尤其是针对深度神经网络(Deep Neural Network, DNN)的防御,主要源于经验性发展,其安全性保证往往仅在事后才得以论证。因此,许多防御依赖于隐含假设,而这些假设随后被日益精巧的攻击所颠覆。这并不令人惊讶:深度学习众所周知缺乏提供有意义保证的完备数学框架。在本文中,我们利用高斯过程在贝叶斯推断框架下研究对抗样本。在不同模型和数据集上,我们发现不确定性的偏离水平反映了最先进攻击(包括针对高斯过程的新型白盒攻击)对良性样本引入的扰动。我们的实验表明,即便未优化的不确定性阈值已在许多场景中拒绝对抗样本。评论:阈值可在改进攻击中被突破,该工作见于 arXiv:1812.02606(对抗设定下模型不确定性的局限性)。

关键词

引用

@article{arxiv.1711.06598,
  title  = {How Wrong Am I? - Studying Adversarial Examples and their Impact on Uncertainty in Gaussian Process Machine Learning Models},
  author = {Kathrin Grosse and David Pfaff and Michael Thomas Smith and Michael Backes},
  journal= {arXiv preprint arXiv:1711.06598},
  year   = {2019}
}

备注

Reasoning incomplete. Fixed issue in arXiv:1812.02606 (The limitations of model uncertainty in adversarial settings)