理解对抗训练中的灾难性过拟合
机器学习
2021-05-10 v1 计算机视觉与模式识别
摘要
近来,FGSM 对抗训练被发现能够训练出与 PGD 训练的鲁棒模型相当但速度快一个数量级的鲁棒模型。然而,存在一种称为灾难性过拟合(CO)的失败模式,即分类器在训练过程中突然丧失鲁棒性且难以自行恢复。本文中,我们发现 CO 不仅限于 FGSM,也发生在 -1 对抗训练中。接着,我们分析了 FGSM 与 -1 的几何性质,发现它们在 CO 之后具有完全不同的决策边界。对于 FGSM,沿扰动方向生成了新的决策边界,使得小扰动比大扰动更有效。而对于 -1,沿扰动方向并未生成新的决策边界,相反 -1 生成的扰动在 CO 之后变小,从而丧失了有效性。我们还通过实验分析了关于导致 CO 潜在因素的三种假设。然后基于实证分析,我们修改了 RS-FGSM,不将扰动投影回 球。通过这一微小改动,我们在 CIFAR10 上以 取得了 的 PGD-50-10 准确率,相比之下 RS-FGSM 为 ,并且还将 在 CIFAR10 上无 CO 发生的工作范围从 8/255 进一步扩展到 11/255。
引用
@article{arxiv.2105.02942,
title = {Understanding Catastrophic Overfitting in Adversarial Training},
author = {Peilin Kang and Seyed-Mohsen Moosavi-Dezfooli},
journal= {arXiv preprint arXiv:2105.02942},
year = {2021}
}