深度学习中的方差缩减:更多动量即所需的一切
机器学习
2021-11-24 v1 计算机视觉与模式识别
摘要
方差缩减(VR)技术在平滑且强凸设定下(Schmidt et al., 2017; Johnson & Zhang, 2013; Roux et al., 2012)对加速大规模数据集的学习贡献显著。然而,由于数据增强或 dropout 等正则化方法的使用(Defazio & Bottou, 2019)等因素,此类技术在大规模深度学习领域尚未取得同等成功。这一挑战近来推动了专为深度学习设计的新型方差缩减技术的出现(Arnold et al., 2019; Ma & Yarats, 2018)。本工作是朝该方向迈出的又一步。具体而言,我们利用深度学习中使用的丰富数据集普遍存在的聚类结构,通过将现有优化器(如 SGD+Momentum、Quasi Hyperbolic Momentum、Implicit Gradient Transport)与多动量策略(Yuan et al., 2019)相结合,设计了一系列可扩展的方差缩减优化流程。我们的方案在标准基准数据集(如 CIFAR 和 ImageNet)上比原始方法收敛更快,对标签噪声具有鲁棒性,并且适用于分布式优化。我们在 JAX 中提供了并行实现。
引用
@article{arxiv.2111.11828,
title = {Variance Reduction in Deep Learning: More Momentum is All You Need},
author = {Lionel Tondji and Sergii Kashubin and Moustapha Cisse},
journal= {arXiv preprint arXiv:2111.11828},
year = {2021}
}
备注
23 pages, 8 figures