利用语义信息提升深度神经网络的对抗鲁棒性
机器学习
2021-06-18 v2 机器学习
摘要
深度神经网络(DNNs)对对抗攻击的脆弱性引发了人们对其鲁棒性的担忧,此类攻击通过刻意扰动原始输入,可使最先进的分类器以高置信度做出错误分类。对抗训练作为提升对抗鲁棒性的主要启发式方法以及抵御对抗攻击的第一道防线,需要大量逐样本计算以扩充训练规模,且通常对整个网络而言强度不足。本文为对抗鲁棒性问题提供了一个新视角,将关注点从整个网络转移到靠近给定类别决策边界的临界区域部分。基于此视角,我们提出一种方法,生成单一但与图像无关的对抗扰动,该扰动携带暗示决策边界上脆弱部分方向的语义信息,并使输入被误分类为指定目标。我们将基于此类扰动的对抗训练称为“区域对抗训练”(RAT),其类似于经典对抗训练,但区别在于它强化了相关区域中缺失的语义信息。在 MNIST 和 CIFAR-10 数据集上的实验结果表明,即便使用训练数据中极小的数据集,该方法也能大幅提升对抗鲁棒性;此外,它还能防御与重训练期间模型所见模式完全不同的 FGSM 对抗攻击。
引用
@article{arxiv.2008.07838,
title = {Improving adversarial robustness of deep neural networks by using semantic information},
author = {Lina Wang and Rui Tang and Yawei Yue and Xingshu Chen and Wei Wang and Yi Zhu and Xuemei Zeng},
journal= {arXiv preprint arXiv:2008.07838},
year = {2021}
}
备注
13 pages, 9 figures