中文

具有可证明对抗鲁棒性的贝叶斯推断

机器学习 2021-02-24 v2 密码学与安全

摘要

我们通过贝叶斯学习的视角考虑深度神经网络的对抗训练,并提出了一个用于具有可证明保证的贝叶斯神经网络 (BNN) 对抗训练的原则性框架。我们依赖非凸优化问题的约束松弛技术,并修改标准交叉熵误差模型,以强制后验对输入点周围 ϵ\epsilon-球中的最坏情况扰动具有鲁棒性。我们说明了所得框架如何与常用于 BNN 近似推断的方法相结合。在实证研究中,我们证明了所提方法能够在 MNIST、FashionMNIST 和 CIFAR-10 上训练出可证明鲁棒的模型,并且也有利于不确定性校准。我们的方法是首个直接训练可证明 BNN 的方法,从而促进了它们在安全关键应用中的部署。

关键词

引用

@article{arxiv.2102.05289,
  title  = {Bayesian Inference with Certifiable Adversarial Robustness},
  author = {Matthew Wicker and Luca Laurenti and Andrea Patane and Zhoutong Chen and Zheng Zhang and Marta Kwiatkowska},
  journal= {arXiv preprint arXiv:2102.05289},
  year   = {2021}
}

备注

Accepted AISTATS2021