中文

理解对抗训练中的灾难性过拟合

机器学习 2021-05-10 v1 计算机视觉与模式识别

摘要

近来,FGSM 对抗训练被发现能够训练出与 PGD 训练的鲁棒模型相当但速度快一个数量级的鲁棒模型。然而,存在一种称为灾难性过拟合(CO)的失败模式,即分类器在训练过程中突然丧失鲁棒性且难以自行恢复。本文中,我们发现 CO 不仅限于 FGSM,也发生在 \mboxDF\mbox{DF}^{\infty}-1 对抗训练中。接着,我们分析了 FGSM 与 \mboxDF\mbox{DF}^{\infty}-1 的几何性质,发现它们在 CO 之后具有完全不同的决策边界。对于 FGSM,沿扰动方向生成了新的决策边界,使得小扰动比大扰动更有效。而对于 \mboxDF\mbox{DF}^{\infty}-1,沿扰动方向并未生成新的决策边界,相反 \mboxDF\mbox{DF}^{\infty}-1 生成的扰动在 CO 之后变小,从而丧失了有效性。我们还通过实验分析了关于导致 CO 潜在因素的三种假设。然后基于实证分析,我们修改了 RS-FGSM,不将扰动投影回 ll_\infty 球。通过这一微小改动,我们在 CIFAR10 上以 ϵ=8/255\epsilon=8/255 取得了 47.56±0.37%47.56 \pm 0.37\% 的 PGD-50-10 准确率,相比之下 RS-FGSM 为 43.57±0.30%43.57 \pm 0.30\% ,并且还将 ϵ\epsilon 在 CIFAR10 上无 CO 发生的工作范围从 8/255 进一步扩展到 11/255。

关键词

引用

@article{arxiv.2105.02942,
  title  = {Understanding Catastrophic Overfitting in Adversarial Training},
  author = {Peilin Kang and Seyed-Mohsen Moosavi-Dezfooli},
  journal= {arXiv preprint arXiv:2105.02942},
  year   = {2021}
}