通过一致性正则化提升神经网络的认证鲁棒性
机器学习
2021-01-21 v2 计算机视觉与模式识别
摘要
已提出一系列防御方法以提升神经网络在对抗样本上的鲁棒性,其中可证明防御方法被证实能有效训练对攻击者具有可证明鲁棒性的神经网络。然而,此类可证明防御方法大多在训练过程中平等对待所有样本,忽视了正确分类(自然)样本与误分类样本间认证鲁棒性约束的不一致性。本文探究由误分类样本引起的该不一致性,并引入新的一致性正则化项以更好地利用误分类样本。具体而言,我们发现若对误分类样本与正确分类样本的认证鲁棒性约束保持一致,网络的认证鲁棒性可显著提升。受此发现启发,我们设计了一种称为误分类感知对抗正则化(MAAR)的新防御正则化项,其在误分类样本的认证区域内约束所有样本的输出概率分布。实验结果表明,与多种最先进方法相比,我们提出的MAAR在CIFAR-10与MNIST数据集上取得了最佳的认证鲁棒性与相当的准确率。
引用
@article{arxiv.2012.13103,
title = {Improving the Certified Robustness of Neural Networks via Consistency Regularization},
author = {Mengting Xu and Tao Zhang and Zhongnian Li and Daoqiang Zhang},
journal= {arXiv preprint arXiv:2012.13103},
year = {2021}
}
备注
4 pages, appeare in AAAI21-RSEML