中文

特征净化:对抗训练如何实现鲁棒深度学习

机器学习 2022-06-14 v4 神经与进化计算 最优化与控制 机器学习

摘要

尽管使用对抗训练来防御深度学习模型免受对抗扰动的实证取得了成功,但迄今为止,对抗扰动存在的原理是什么、以及对抗训练对神经网络做了什么以去除它们,仍相当不清楚。在本文中,我们提出一个称为特征净化的原理,其中我们表明对抗样本存在的一个原因是神经网络训练过程中隐藏权重里某些小的稠密混合物的累积;更重要的是,对抗训练的目标之一是去除此类混合物以净化隐藏权重。我们给出了在 CIFAR-10 数据集上的实验来说明该原理,以及一个理论结果,证明对于某些自然分类任务,使用随机初始化梯度下降训练带 ReLU 激活的两层神经网络确实满足该原理。从技术上讲,据我们所知,我们给出了首个证明以下两点可同时成立用于训练带 ReLU 激活的神经网络的结果。(1)在原数据上的训练确实对某些半径的小对抗扰动非鲁棒。(2)对抗训练,即使采用如 FGM 这样的经验扰动算法,实际上可证明对该相同半径的任意扰动鲁棒。最后,我们还证明了一个复杂度下界,表明低复杂度模型如线性分类器、低次多项式、甚至该网络的神经正切核,无论使用何种算法训练,都无法防御该相同半径的扰动。

关键词

引用

@article{arxiv.2005.10190,
  title  = {Feature Purification: How Adversarial Training Performs Robust Deep Learning},
  author = {Zeyuan Allen-Zhu and Yuanzhi Li},
  journal= {arXiv preprint arXiv:2005.10190},
  year   = {2022}
}

备注

v2 and V3 polish writing and experiments, V4 adds experiments showing that adversarial training can be done through low-rank updates