中文

稳定化 NeuralODE 的对抗鲁棒性可能源于混淆梯度

机器学习 2021-06-03 v2 机器学习

摘要

本文提出一种可证明稳定的 Neural Ordinary Differential Equations(ODEs)架构,即使网络以自然方式训练,也能在白盒对抗攻击下取得非平凡的对抗鲁棒性。对于大多数抵御强白盒攻击的现有防御方法,为提高神经网络鲁棒性,它们需要对抗训练,因而不得不在自然准确率与对抗鲁棒性之间权衡。受动力系统理论启发,我们设计了一个稳定化神经 ODE 网络,称为 SONet,其 ODE 块为斜对称且被证明是输入输出稳定的。通过自然训练,SONet 能在不牺牲自然准确率的前提下,达到与最先进对抗防御方法相当的鲁棒性。即便仅将 ResNet 的第一层替换为这样的 ODE 块,也能展现鲁棒性的进一步提升,例如在 CIFAR-10 数据集上 PGD-20(=0.031\ell_\infty=0.031)攻击下,其取得 91.57% 的自然准确率与 62.35% 的鲁棒准确率,而使用 TRADES 训练的 ResNet 对应架构的自然与鲁棒准确率分别为 76.29% 与 45.24%。为理解这一惊人结果背后的可能原因,我们进一步探究此种对抗鲁棒性背后的可能机制。我们表明,自适应步长数值 ODE 求解器 DOPRI5 具有梯度掩蔽效应,使依赖于训练损失梯度信息的 PGD 攻击失效;另一方面,它无法欺骗具有鲁棒梯度的 CW 攻击与无梯度的 SPSA 攻击。这提供了一种新解释:基于 ODE 的网络之对抗鲁棒性主要源自数值 ODE 求解器中的混淆梯度。

关键词

引用

@article{arxiv.2009.13145,
  title  = {Adversarial Robustness of Stabilized NeuralODEs Might be from Obfuscated Gradients},
  author = {Yifei Huang and Yaodong Yu and Hongyang Zhang and Yi Ma and Yuan Yao},
  journal= {arXiv preprint arXiv:2009.13145},
  year   = {2021}
}

备注

16 pages