深度学习中权重指数移动平均的动力学与优势
机器学习
2024-12-02 v1
摘要
随机梯度下降(SGD)迭代的权重平均是深度学习模型训练中流行的方法。虽然它常被用作复杂训练管道的一部分以改进泛化或作为“教师”模型,但权重平均缺乏独立的评估。本文对权重指数移动平均(EMA)进行系统性研究。我们首先探讨EMA的训练动力学,给出超参数调优指南,突出其良好的早期性能,部分解释了其作为教师模型的成功。我们还观察到EMA所需的学习率衰减小于SGD,因为平均化自然降低了噪声,引入一种形式的隐式正则化。通过大量实验,我们显示EMA解与最后迭代解不同。EMA模型不仅在一般化方面表现更好,而且在i)对噪声标签的鲁棒性、ii)预测一致性、iii)校准和iv)迁移学习方面均表现出改进。因此,我们建议权重指数移动平均是一种简单而有效的插拨式方法,用于提高深度学习模型的性能。
引用
@article{arxiv.2411.18704,
title = {Exponential Moving Average of Weights in Deep Learning: Dynamics and Benefits},
author = {Daniel Morales-Brotons and Thijs Vogels and Hadrien Hendrikx},
journal= {arXiv preprint arXiv:2411.18704},
year = {2024}
}
备注
27 pages, 9 figures. Accepted at TMLR, April 2024