中文

FixNorm:剖析权重衰减以训练深度神经网络

机器学习 2021-03-30 v1 计算机视觉与模式识别

摘要

权重衰减是一种广泛用于训练深度神经网络(DNN)的技术。它极大影响泛化性能,但其内在机制尚未被完全理解。近期工作表明,对于接在归一化层之后的层,权重衰减主要影响有效学习率。然而,尽管现代DNN已广泛采用归一化,像最终全连接层这样的层并不满足此前提条件。对于这些层,权重衰减的影响仍不清楚。本文中,我们全面研究了权重衰减的机制,发现除影响有效学习率外,权重衰减还有另一同等重要的独特机制:通过控制跨边界风险来影响泛化性能。这两种机制共同对权重衰减的影响给出了更全面的解释。基于该发现,我们提出了一种称为FixNorm的新训练方法,它舍弃权重衰减并直接控制这两种机制。我们还提出了一种简单而有效的FixNorm超参数调节方法,能在少量试验中找到近最优解。在ImageNet分类任务上,使用FixNorm训练EfficientNet-B0达到77.7%,明显优于原始基线。令人惊讶的是,当将MobileNetV2缩放到相同FLOPS并应用与EfficientNet-B0相同的技巧时,使用FixNorm训练达到77.4%,仅低0.3%。一系列SOTA结果表明良好调优训练流程的重要性,并进一步验证了我们所提方法的有效性。我们使用FixNorm建立了更多良好调优的基线,以促进社区中的公平比较。

关键词

引用

@article{arxiv.2103.15345,
  title  = {FixNorm: Dissecting Weight Decay for Training Deep Neural Networks},
  author = {Yucong Zhou and Yunxiao Sun and Zhao Zhong},
  journal= {arXiv preprint arXiv:2103.15345},
  year   = {2021}
}