对抗环境下模型不确定性的局限
密码学与安全
2019-11-19 v2 机器学习
摘要
机器学习模型易受对抗样本攻击:即对输入样本施加微小扰动以故意导致误分类。尽管这显然是一种安全威胁,对抗样本也能揭示所应用模型自身的特性。我们在贝叶斯神经网络(BNN)不确定性度量的背景下研究对抗样本。由于这些度量高度非光滑,我们采用光滑的高斯过程分类器(GPC)作为替代。我们表明,即便输出错误,置信度与不确定性都可能表现正常而无异样。有趣的是,我们发现对于大多数任务,影响不确定性与置信度的特征存在细微差异。
引用
@article{arxiv.1812.02606,
title = {The Limitations of Model Uncertainty in Adversarial Settings},
author = {Kathrin Grosse and David Pfaff and Michael Thomas Smith and Michael Backes},
journal= {arXiv preprint arXiv:1812.02606},
year = {2019}
}
备注
Accepted to the Bayesian Deep Learning Workshop 2019 at NeurIPS. For longer version with more background, refer to previous version