自然训练中的SGD超参数如何影响对抗鲁棒性?
计算机视觉与模式识别
2020-06-23 v1 密码学与安全
机器学习
机器学习
摘要
学习率、批大小(batch size)和动量是SGD算法中的三个重要超参数。Jastrzebski等人(arXiv:1711.04623)的工作已知,神经网络的大批大小训练产生的模型泛化性能不佳。Yao等人(arXiv:1802.08241)观察到,大批训练产生的模型对抗鲁棒性较差。在同一篇论文中,作者用不同批大小训练模型并计算损失函数Hessian的特征值。他们观察到,随着批大小增大,Hessian的主导特征值变大。他们还表明,对抗训练和小批训练都会导致Hessian主导特征值下降或其谱降低。他们将对抗训练与二阶信息结合,提出了一种新的大批训练算法,并获得了具有良好泛化能力的鲁棒模型。在本文中,我们通过实验观察了SGD超参数对使用未扰动样本训练的网络的准确率和对抗鲁棒性的影响。Jastrzebski等人考虑以固定的学习率与批大小之比训练模型,观察到该比值越高,泛化越好。我们观察到,按照Jastrzebski等人提出的方法,以恒定学习率与批大小之比训练的神经网络所产生的模型泛化良好,且对抗鲁棒性几乎恒定,与批大小无关。我们观察到,在变化的批大小和固定学习率下,动量比基于恒定学习率与批大小之比的SGD训练更有效。
引用
@article{arxiv.2006.11604,
title = {How do SGD hyperparameters in natural training affect adversarial robustness?},
author = {Sandesh Kamath and Amit Deshpande and K V Subrahmanyam},
journal= {arXiv preprint arXiv:2006.11604},
year = {2020}
}
备注
Preliminary version presented in ICML 2019 Workshop on "Understanding and Improving Generalization in Deep Learning" as "On Adversarial Robustness of Small vs Large Batch Training"