针对对抗攻击的二阶可证明防御
机器学习
2020-06-02 v1 机器学习
摘要
鲁棒性证书是给定输入到分类器决策边界的最小距离(或其下界)。对于幅度小于证书值的任何输入扰动,分类输出将可证明地保持不变。精确计算神经网络的鲁棒性证书是困难的,因为这需要求解非凸优化。本文中,我们为具有可微激活函数的神经网络提供计算高效的鲁棒性证书,分两步进行。首先,我们证明若网络 Hessian 矩阵的特征值有界,则可利用凸优化高效计算 范数下的鲁棒性证书。其次,我们推导出深度网络曲率的计算高效可微上界。我们还将该曲率界作为正则化项在网络训练中使用,以提升其认证鲁棒性。综合这些结果形成了我们提出的基于曲率的鲁棒性证书(CRC)与基于曲率的鲁棒训练(CRT)。我们的数值结果表明,与基于区间界传播(IBP)的训练相比,CRT 带来了显著更高的认证鲁棒准确率。在 MNIST 数据集上,我们在 2、3 和 4 层网络上分别取得了 69.79%、57.78% 和 53.19% 的认证鲁棒准确率,而基于 IBP 的方法分别取得 44.96%、44.74% 和 44.66%。
引用
@article{arxiv.2006.00731,
title = {Second-Order Provable Defenses against Adversarial Attacks},
author = {Sahil Singla and Soheil Feizi},
journal= {arXiv preprint arXiv:2006.00731},
year = {2020}
}