中文

基于贝叶斯神经网络的高效可迁移对抗样本

机器学习 2022-06-22 v4 机器学习

摘要

一种公认的改进黑盒规避攻击可迁移性的方法是基于集成代理来增加多样性以构造对抗样本。我们认为可迁移性从根本上与不确定性相关。基于一种先进的贝叶斯深度学习技术,我们提出了一种新方法,通过从神经网络权重的后验分布中近似采样来高效构建代理,该后验分布表示对各参数取值的信念。我们在ImageNet、CIFAR-10和MNIST上的大量实验表明,我们的方法显著提高了四种最先进攻击的成功率(最高达83.2个百分点),无论是在同架构还是跨架构可迁移性上。在ImageNet上,与独立训练的DNN集成相比,我们的方法可达到94%的成功率,同时将训练计算量从11.6 exaflops降至2.4 exaflops。我们的朴素代理在87.5%的情况下比三种为此目的设计的测试时技术具有更高的可迁移性。我们的工作表明,代理的训练方式一直被忽视,尽管它是基于迁移的攻击中的重要环节。因此,我们首次回顾了若干训练方法在提升可迁移性上的有效性。我们为更好地理解可迁移性现象提供了新方向,并为未来工作提供了一个简单但强劲的基线。

关键词

引用

@article{arxiv.2011.05074,
  title  = {Efficient and Transferable Adversarial Examples from Bayesian Neural Networks},
  author = {Martin Gubri and Maxime Cordy and Mike Papadakis and Yves Le Traon and Koushik Sen},
  journal= {arXiv preprint arXiv:2011.05074},
  year   = {2022}
}

备注

Accepted at UAI 2022