灾难性过拟合的层感知分析:揭示伪鲁棒捷径依赖性
机器学习
2024-09-17 v2
摘要
灾难性过拟合(CO)是单步对抗训练(AT)中的一个重大挑战,表现为深度神经网络(DNN)高度扭曲,容易受到多步对抗攻击。然而,导致决策边界扭曲的潜在因素仍不清楚。在这项工作中,我们深入研究了不同 DNN 层内的具体变化,发现在 CO 期间,前层更容易受到影响,经历更早且更严重的扭曲,而后层则相对不敏感。我们的分析进一步揭示,前层敏感性的增加源于伪鲁棒捷径的形成,这些捷径本身可以完美地防御单步对抗攻击,但绕过了真正的鲁棒学习,导致决策边界扭曲。消除这些捷径可以部分恢复 DNN 从 CO 状态中的鲁棒性,从而验证了对它们的依赖触发了 CO 的发生。这一理解促使我们在不同层上实施自适应权重扰动,以阻碍伪鲁棒捷径的生成,从而缓解 CO。大量实验表明,我们提出的方法——层感知对抗权重扰动(LAP)——能够有效防止 CO 并进一步增强鲁棒性。
引用
@article{arxiv.2405.16262,
title = {Layer-Aware Analysis of Catastrophic Overfitting: Revealing the Pseudo-Robust Shortcut Dependency},
author = {Runqi Lin and Chaojian Yu and Bo Han and Hang Su and Tongliang Liu},
journal= {arXiv preprint arXiv:2405.16262},
year = {2024}
}
备注
Accepted by ICML 2024