中文

在不损害准确率的前提下破坏深度不确定性估计

机器学习 2021-12-03 v1 密码学与安全 机器学习

摘要

深度神经网络(DNNs)已被证明是强大的预测器,并广泛用于各类任务。然而,对其预测的可信不确定性估计,对于其在许多风险敏感应用中的部署至关重要。本文提出一种新颖且简单的攻击,与对抗攻击不同,它不会引起错误预测,而是削弱网络的不确定性估计能力。其结果是攻击后 DNN 对其错误预测的置信度高于正确预测,且准确率未下降。我们提出该攻击的两个版本。第一种场景关注黑盒机制(攻击者对目标网络无知识),第二种场景攻击白盒设定。所提攻击仅需极小幅度的扰动即可造成严重的不确定性估计损害,更大幅度会导致完全不可用之不确定性估计。我们展示了对三种最流行不确定性估计方法的成功攻击:原生 softmax 分数、Deep Ensembles 和 MC-Dropout。此外,我们展示了对选择性分类架构 SelectiveNet 的攻击。我们在若干当代架构(如 MobileNetV2 和 EfficientNetB0,均训练用于分类 ImageNet)上测试了所提攻击。

关键词

引用

@article{arxiv.2110.13741,
  title  = {Disrupting Deep Uncertainty Estimation Without Harming Accuracy},
  author = {Ido Galil and Ran El-Yaniv},
  journal= {arXiv preprint arXiv:2110.13741},
  year   = {2021}
}

备注

To be published in NeurIPS 2021