FixNorm:剖析权重衰减以训练深度神经网络
机器学习
2021-03-30 v1 计算机视觉与模式识别
摘要
权重衰减是一种广泛用于训练深度神经网络(DNN)的技术。它极大影响泛化性能,但其内在机制尚未被完全理解。近期工作表明,对于接在归一化层之后的层,权重衰减主要影响有效学习率。然而,尽管现代DNN已广泛采用归一化,像最终全连接层这样的层并不满足此前提条件。对于这些层,权重衰减的影响仍不清楚。本文中,我们全面研究了权重衰减的机制,发现除影响有效学习率外,权重衰减还有另一同等重要的独特机制:通过控制跨边界风险来影响泛化性能。这两种机制共同对权重衰减的影响给出了更全面的解释。基于该发现,我们提出了一种称为FixNorm的新训练方法,它舍弃权重衰减并直接控制这两种机制。我们还提出了一种简单而有效的FixNorm超参数调节方法,能在少量试验中找到近最优解。在ImageNet分类任务上,使用FixNorm训练EfficientNet-B0达到77.7%,明显优于原始基线。令人惊讶的是,当将MobileNetV2缩放到相同FLOPS并应用与EfficientNet-B0相同的技巧时,使用FixNorm训练达到77.4%,仅低0.3%。一系列SOTA结果表明良好调优训练流程的重要性,并进一步验证了我们所提方法的有效性。我们使用FixNorm建立了更多良好调优的基线,以促进社区中的公平比较。
引用
@article{arxiv.2103.15345,
title = {FixNorm: Dissecting Weight Decay for Training Deep Neural Networks},
author = {Yucong Zhou and Yunxiao Sun and Zhao Zhong},
journal= {arXiv preprint arXiv:2103.15345},
year = {2021}
}