通过异常对抗样本正则化消除灾难性过拟合
机器学习
2024-09-17 v2
摘要
单步对抗训练(SSAT)已展现出兼顾效率与鲁棒性的潜力。然而,SSAT 会遭遇灾难性过拟合(CO),这种现象会导致分类器严重失真,使其容易受到多步对抗攻击。在本工作中,我们观察到在 SSAT 训练的网络上生成的一些对抗样本表现出异常行为,即尽管这些训练样本是由内部最大化过程生成的,但其相关损失反而下降了,我们将其命名为异常对抗样本(AADE)。经过进一步分析,我们发现 AAE 与分类器失真之间存在密切关系,因为随着 CO 的出现,AAE 的数量和输出都会发生显著变化。鉴于这一观察,我们重新审视了 SSAT 过程,并发现在 CO 发生之前,分类器已经表现出轻微的失真,这由少量 AAE 的存在所表明。此外,分类器直接优化这些 AAE 会加速其失真,相应地,AAE 的变化也会因此急剧增加。在这种恶性循环中,分类器迅速变得高度失真,并在几次迭代中表现为 CO。这些观察促使我们通过阻碍 AAE 的生成来消除 CO。具体而言,我们设计了一种名为异常对抗样本正则化(AAER)的新方法,该方法显式地对 AAE 的变化进行正则化,以阻碍分类器变得失真。大量实验表明,我们的方法能够有效消除 CO,并以可忽略的额外计算开销进一步提升对抗鲁棒性。
引用
@article{arxiv.2404.08154,
title = {Eliminating Catastrophic Overfitting Via Abnormal Adversarial Examples Regularization},
author = {Runqi Lin and Chaojian Yu and Tongliang Liu},
journal= {arXiv preprint arXiv:2404.08154},
year = {2024}
}
备注
Accepted by NeurIPS 2023