对抗样本博弈
机器学习
2021-01-12 v6 人工智能
计算机视觉与模式识别
机器学习
摘要
能够欺骗训练好的神经网络分类器的对抗样本的存在,要求人们更好地理解可能的攻击,以指导针对它们的防护措施的发展。这包括在具有挑战性的非交互黑盒设定下的攻击方法,其中对抗攻击是在无任何访问(包括查询)目标模型的情况下生成的。该设定下的先前攻击主要依赖于从经验观察(例如,动量有帮助)得出的算法创新,缺乏原则性的可迁移性保证。在这项工作中,我们为针对整个假设类制作可迁移对抗样本提供了理论基础。我们引入对抗样本博弈(AEG),一个将对抗样本的制作建模为攻击生成器与分类器之间极小极大博弈的框架。AEG 通过从给定假设类(例如,架构)对抗训练一个生成器和一个分类器,提供了一种设计对抗样本的新方式。我们证明该博弈存在均衡,且最优生成器能够制作可攻击对应假设类中任何分类器的对抗样本。我们在 MNIST 和 CIFAR-10 数据集上展示了 AEG 的有效性,相对于先前最先进方法分别取得了平均相对改进 和 (表 2 和表 3)。
引用
@article{arxiv.2007.00720,
title = {Adversarial Example Games},
author = {Avishek Joey Bose and Gauthier Gidel and Hugo Berard and Andre Cianflone and Pascal Vincent and Simon Lacoste-Julien and William L. Hamilton},
journal= {arXiv preprint arXiv:2007.00720},
year = {2021}
}
备注
Appears in: Advances in Neural Information Processing Systems 33 (NeurIPS 2020)