中文

利用 01 损失防御替代模型黑盒对抗攻击

机器学习 2020-09-22 v1 人工智能 密码学与安全 计算机视觉与模式识别

摘要

替代模型黑盒攻击仅通过访问目标模型的输出标签即可为其生成对抗样本。这对实际应用中的机器学习模型,尤其是安全敏感应用,构成了重大挑战。已知 01 损失模型比实践中通常使用的凸模型对离群值与噪声更具鲁棒性。受这些性质启发,我们提出 01 损失线性模型与 01 损失双层神经网络模型,作为针对基于迁移的替代模型黑盒攻击的防御手段。我们在流行的图像基准上比较了以我们的 01 损失模型及其凸对应模型为目标的替代模型黑盒攻击所生成对抗样本的准确率(二分类任务)。我们的 01 损失双层神经网络在 MNIST、CIFAR10、STL10 和 ImageNet 上的对抗准确率分别为 66.2%、58%、60.5% 和 57%,而 sigmoid 激活 logistic 损失对应模型的准确率分别为 63.5%、19.3%、14.9% 和 27.6%。除 MNIST 外,凸对应模型的对抗准确率显著更低。我们展示了我们的模型在抵御交通标志与人脸识别对抗攻击中的实际应用。在 GTSRB 街道标志与 CelebA 人脸检测上,我们的 01 损失网络的对抗准确率分别为 34.6% 与 37.1%,而凸 logistic 对应模型的准确率分别为 24% 与 1.9%。最后我们表明,即便使用卷积网络替代模型进行攻击,我们的 01 损失网络也能达到与简单卷积神经网络相当的鲁棒性,且远高于其凸对应模型。我们的工作表明 01 损失模型为抵御替代模型黑盒攻击提供了强有力的防御。

关键词

引用

@article{arxiv.2009.09803,
  title  = {Defending against substitute model black box adversarial attacks with the 01 loss},
  author = {Yunzhe Xue and Meiyan Xie and Usman Roshan},
  journal= {arXiv preprint arXiv:2009.09803},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:2006.07800; text overlap with arXiv:2008.09148