中文

对抗训练的鲁棒性、隐私性与泛化能力

机器学习 2020-12-29 v1 人工智能 密码学与安全 机器学习

摘要

对抗训练能显著增强深度神经网络以抵御对抗攻击的鲁棒性。然而,一些工作指出对抗训练可能损害隐私保护与泛化能力。本文从理论与实证两方面建立并量化了对抗训练中的隐私-鲁棒性权衡与泛化-鲁棒性权衡。我们首先定义一个概念,即“鲁棒化强度(robustified intensity)”来衡量对抗训练算法的鲁棒性。该度量可由一个渐近一致的经验估计量“经验鲁棒化强度(empirical robustified intensity)”近似估计。基于鲁棒化强度,我们证明:(1) 对抗训练是 (ε,δ)(\varepsilon, \delta)-差分私密的,其中差分隐私的量级与鲁棒化强度呈正相关;以及 (2) 对抗训练的泛化误差可被 O(logN/N)\mathcal O(\sqrt{\log N}/N) 的平均界与 O(1/N)\mathcal O(1/\sqrt{N}) 的高概率界所上界约束,二者均与鲁棒化强度呈正相关。此外,我们的泛化界并不显式依赖于参数规模,而该规模在深度学习中可能大得难以处理。在标准数据集 CIFAR-10 与 CIFAR-100 上的系统性实验与我们的理论完全吻合。源代码包可在 \url{https://github.com/fshp971/RPG} 获取。

关键词

引用

@article{arxiv.2012.13573,
  title  = {Robustness, Privacy, and Generalization of Adversarial Training},
  author = {Fengxiang He and Shaopeng Fu and Bohan Wang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2012.13573},
  year   = {2020}
}