中文

基于信赖域的神经网络对抗攻击

机器学习 2021-04-21 v1 密码学与安全 机器学习

摘要

深度神经网络对对抗扰动相当脆弱。当前最先进的对抗攻击方法通常需要非常耗时的超参数调优,或者需要多次迭代来求解基于优化的对抗攻击。为解决此问题,我们提出了一系列基于信赖域的对抗攻击新方法,旨在高效地计算对抗扰动。我们基于信赖域优化方法的若干变体提出了几种攻击。我们在 Cifar-10 和 ImageNet 数据集上使用包括 AlexNet、ResNet-50、VGG-16 和 DenseNet-121 模型在内的多个不同模型测试了所提方法。我们的方法取得了与 Carlini-Wagner (CW) 攻击相当的结果,但在 Titan Xp GPU 上对 VGG-16 模型实现了高达 37×37\times 的显著加速。对于 ImageNet 上的 ResNet-50 情况,我们可将其分类准确率降至低于 0.1\%,仅需最多 1.5%1.5\% 的相对 LL_\infty(或 L2L_2)扰动,且只需 1.021.02 秒,而 CW 攻击需 27.0427.04 秒。我们已开源我们的方法,可在 [1] 处访问。

关键词

引用

@article{arxiv.1812.06371,
  title  = {Trust Region Based Adversarial Attack on Neural Networks},
  author = {Zhewei Yao and Amir Gholami and Peng Xu and Kurt Keutzer and Michael Mahoney},
  journal= {arXiv preprint arXiv:1812.06371},
  year   = {2021}
}