具有可证明对抗鲁棒性的贝叶斯推断
机器学习
2021-02-24 v2 密码学与安全
摘要
我们通过贝叶斯学习的视角考虑深度神经网络的对抗训练,并提出了一个用于具有可证明保证的贝叶斯神经网络 (BNN) 对抗训练的原则性框架。我们依赖非凸优化问题的约束松弛技术,并修改标准交叉熵误差模型,以强制后验对输入点周围 -球中的最坏情况扰动具有鲁棒性。我们说明了所得框架如何与常用于 BNN 近似推断的方法相结合。在实证研究中,我们证明了所提方法能够在 MNIST、FashionMNIST 和 CIFAR-10 上训练出可证明鲁棒的模型,并且也有利于不确定性校准。我们的方法是首个直接训练可证明 BNN 的方法,从而促进了它们在安全关键应用中的部署。
引用
@article{arxiv.2102.05289,
title = {Bayesian Inference with Certifiable Adversarial Robustness},
author = {Matthew Wicker and Luca Laurenti and Andrea Patane and Zhoutong Chen and Zheng Zhang and Marta Kwiatkowska},
journal= {arXiv preprint arXiv:2102.05289},
year = {2021}
}
备注
Accepted AISTATS2021