基于凸外对抗多面体的可证明对抗样本防御方法
机器学习
2018-06-12 v3 人工智能
最优化与控制
摘要
我们提出一种学习基于深度 ReLU 的分类器的方法,该分类器对训练数据上范数有界的对抗扰动具有可证明的鲁棒性。对于此前未见的样本,该方法保证能检测出所有对抗样本,尽管也可能将一些非对抗样本误报为对抗样本。基本思想是考虑通过范数有界扰动可达的激活集合的凸外近似,并开发一种鲁棒优化过程,在该外区域上最小化最坏情况损失(通过一个线性规划)。关键在于,我们证明该线性规划的对偶问题本身可表示为一个类似于反向传播网络的深度网络,从而产生了非常高效的优化方法,可给出鲁棒损失的可保证界。最终结果在于,通过对原始网络稍作修改的版本(尽管批大小可能大得多)执行几次额外的前向与后向传播,我们就能学习到一个对任何范数有界对抗攻击都具有可证明鲁棒性的分类器。我们在若干任务上展示了该方法,以训练具有鲁棒对抗保证的分类器(例如,对于 MNIST,我们生成了一个卷积分类器,可证明对于任何范数有界 小于 的对抗攻击,测试误差小于 5.8%),本文所有实验的代码可在 https://github.com/locuslab/convex_adversarial 获取。
引用
@article{arxiv.1711.00851,
title = {Provable defenses against adversarial examples via the convex outer adversarial polytope},
author = {Eric Wong and J. Zico Kolter},
journal= {arXiv preprint arXiv:1711.00851},
year = {2018}
}
备注
ICML final version