中文

现代深度学习中为何需要权重衰减?

机器学习 2024-11-06 v2

摘要

权重衰减是一种广泛用于训练最先进深度网络的技术,从图像分类到大语言模型皆然。尽管其使用广泛且在经典文献中被深入研究,其在深度学习中的作用仍鲜为人知。本工作中,我们强调现代深度学习中权重衰减的作用不同于经典学习理论中研究的其正则化效应。对于使用多遍 SGD 训练的视觉任务深度网络,我们展示了权重衰减如何通过损失稳定机制修改优化动态,增强 SGD 始终存在的隐式正则化。相反,对于使用近单轮训练的大语言模型,我们描述了权重衰减如何平衡随机优化中的偏差-方差权衡,从而导致更低的训练损失与改善的训练稳定性。总体而言,我们提出了从视觉任务上的 ResNets 到 LLMs 的统一视角:权重衰减从不作为显式正则化器有用,而是以理想方式改变训练动态。代码见 https://github.com/tml-epfl/why-weight-decay

关键词

引用

@article{arxiv.2310.04415,
  title  = {Why Do We Need Weight Decay in Modern Deep Learning?},
  author = {Francesco D'Angelo and Maksym Andriushchenko and Aditya Varre and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2310.04415},
  year   = {2024}
}