中文

通过局部线性化实现对抗鲁棒性

机器学习 2019-10-11 v2 机器学习

摘要

对抗训练是一种训练对范数有界对抗扰动具有鲁棒性的深度神经网络的有效方法。然而,随着模型规模与输入维数增加,对抗训练的计算成本变得高得令人望而却步。此外,针对较廉价因而较弱的对手进行训练所产生的模型,虽对弱攻击鲁棒,但在更强攻击下会失效。这常归因于梯度混淆现象;此类模型在训练样本附近的损失曲面高度非线性,使得基于梯度的攻击难以成功,尽管对抗样本依然存在。本工作中,我们引入一种新颖的正则化器,鼓励损失在训练数据附近呈线性行为,从而在惩罚梯度混淆的同时促进鲁棒性。我们通过 CIFAR-10 与 ImageNet 上的大量实验表明,用我们的正则化器训练的模型避免了梯度混淆,且可比对抗训练显著更快训练。使用该正则化器,我们超越了当前最优水平,在半径 4/255 的 l-infinity 对抗扰动下、非定向强白盒攻击中,于 ImageNet 上达到 47% 的对抗准确率。此外,我们在 CIFAR-10 上以 8/255 的扰动匹配了最优结果。

关键词

引用

@article{arxiv.1907.02610,
  title  = {Adversarial Robustness through Local Linearization},
  author = {Chongli Qin and James Martens and Sven Gowal and Dilip Krishnan and Krishnamurthy Dvijotham and Alhussein Fawzi and Soham De and Robert Stanforth and Pushmeet Kohli},
  journal= {arXiv preprint arXiv:1907.02610},
  year   = {2019}
}