从表示复杂性与训练动态两个理论视角看对抗训练中的干净泛化与鲁棒过拟合
机器学习
2025-05-23 v4 机器学习
摘要
与标准深度学习中的惊人性能类似,经对抗训练深度网络对未见干净数据(自然数据)也具有良好的泛化能力。然而,尽管对抗训练可实现较低的鲁棒训练误差,仍存在显著的鲁棒泛化差距。我们称此现象为干净泛化与鲁棒过拟合(CGRO)。本文从两个视角研究对抗训练中的 CGRO 现象:表示复杂性与训练动态。具体而言,我们考虑具有 个可分训练数据点的二分类设定。首先,我们证明,在假设存在 规模干净分类器(其中 为数据维度)的前提下,仅多出 参数的 ReLU 网络即可利用鲁棒记忆实现 CGRO,而鲁棒分类器在最坏情况下仍需指数级表示复杂性。接着,我们聚焦于结构化数据情形以分析训练动态,其中我们训练宽度为 的两层卷积网络以抵御对抗扰动。我们随后展示学习过程中发生三阶段相变,网络可证明收敛至鲁棒记忆机制,从而导致 CGRO。此外,我们还在真实图像识别数据集上通过实验对理论分析进行了实证验证。
引用
@article{arxiv.2306.01271,
title = {On the Clean Generalization and Robust Overfitting in Adversarial Training from Two Theoretical Views: Representation Complexity and Training Dynamics},
author = {Binghui Li and Yuanzhi Li},
journal= {arXiv preprint arXiv:2306.01271},
year = {2025}
}
备注
Published as a conference paper at ICML 2025; 28 pages