中文

对抗训练的稳定性分析与泛化界

机器学习 2022-11-01 v2

摘要

在对抗机器学习中,深度神经网络可拟合训练集上的对抗样本,但在测试集上泛化能力较差。该现象称为鲁棒过拟合,在包括 SVHN、CIFAR-10、CIFAR-100 和 ImageNet 在内的常见数据集上对抗训练神经网络时均可观察到。本文利用一致稳定性工具研究对抗训练的鲁棒过拟合问题。一个主要挑战是外部函数(作为内部函数的最大化)非光滑,因此标准技术(如 hardt 等人,2016)无法应用。我们的方法是考虑 η\eta-近似光滑性:我们证明外部函数满足该修正的光滑性假设,其中 η\eta 为与对抗扰动 ϵ\epsilon 相关的常数。基于此,我们推导了随机梯度下降(SGD)在涵盖对抗损失的通用 η\eta-近似光滑函数类上的基于稳定性的泛化界。我们的结果表明,当 TT 较大时,鲁棒测试精度以介于 Ω(ϵT)\Omega(\epsilon\sqrt{T})O(ϵT)\mathcal{O}(\epsilon T) 之间的速度随 ϵ\epsilon 增大而下降。该现象在实践中亦被观察到。此外,我们表明几种流行的对抗训练技术(例如早停、循环学习率和随机权重平均)在理论上是促进稳定性的。

关键词

引用

@article{arxiv.2210.00960,
  title  = {Stability Analysis and Generalization Bounds of Adversarial Training},
  author = {Jiancong Xiao and Yanbo Fan and Ruoyu Sun and Jue Wang and Zhi-Quan Luo},
  journal= {arXiv preprint arXiv:2210.00960},
  year   = {2022}
}

备注

Published as a conference paper in NeurIPS2022