理想化模型无对抗样本的充分条件:基于贝叶斯神经网络的理论与实证研究
机器学习
2018-07-02 v3 机器学习
摘要
我们在两个充分条件之下证明,理想化模型可以没有对抗样本。我们讨论哪些理想化模型满足我们的条件,并表明理想化贝叶斯神经网络 (BNN) 满足这些条件。我们继续利用 HMC 推断研究近理想化 BNN,在实践中展示这些理论思想。我们在源自 MNIST 的合成数据上实验 HMC,已知其真实图像密度,表明近乎完美的认知不确定性对应于图像流形下的密度,且对抗图像在我们的设定中位于流形之外。这暗示了可被视为执行近似推断的 MC dropout 为何在实践中被观察到是对抗样本的有效防御;我们强调了依赖 dropout 的非理想化 BNN 的失败案例,并由此提出一种针对 dropout 模型的新攻击与一种新防御。最后,我们在猫狗图像分类任务上用 VGG13 变体展示了该防御。
引用
@article{arxiv.1806.00667,
title = {Sufficient Conditions for Idealised Models to Have No Adversarial Examples: a Theoretical and Empirical Study with Bayesian Neural Networks},
author = {Yarin Gal and Lewis Smith},
journal= {arXiv preprint arXiv:1806.00667},
year = {2018}
}