自适应引力:一种对抗对抗样本的防御方法
机器学习
2022-04-11 v1 计算机视觉与模式识别
摘要
本文提出了一种新颖的模型训练方案,称为自适应引力(Adaptive-Gravity),用于增强深度神经网络分类器对抗对抗样本的鲁棒性。我们将与每个类别相关的模型参数/特征概念化为一个质量体,其特征由其质心位置和特征围绕质心的散布(距离的标准差)来表征。我们利用与每个簇相关的质心推导出一种反引力,在网络训练过程中将不同类别的质心彼此推开。然后,我们定制了一个目标函数,旨在将每个类别的特征向其对应的新质心集中,该新质心已通过反引力获得。这种方法导致不同质量体之间更大的分离,并减少了每个质心周围特征的散布。结果,样本被推离对抗样本可能映射到的空间,有效增加了制造对抗样本所需的扰动程度。我们已将此训练方案实现为一个迭代方法,每次迭代包含四个步骤:1)质心提取,2)反引力计算,3)质心重定位,以及 4)引力训练。引力的效率通过测量针对各种攻击模型(包括 FGSM、MIM、BIM 和 PGD)的相应愚弄率来评估,使用 LeNet 和 ResNet110 网络,以 MNIST 和 CIFAR10 分类问题为基准。测试结果表明,引力不仅作为一种强大的工具,使模型对最先进的对抗攻击具有鲁棒性,而且还有效提高了模型训练精度。
引用
@article{arxiv.2204.03694,
title = {Adaptive-Gravity: A Defense Against Adversarial Samples},
author = {Ali Mirzaeian and Zhi Tian and Sai Manoj P D and Banafsheh S. Latibari and Ioannis Savidis and Houman Homayoun and Avesta Sasan},
journal= {arXiv preprint arXiv:2204.03694},
year = {2022}
}