关于权重衰减被忽视的缺陷及其缓解:基于梯度范数的视角
机器学习
2024-08-19 v6 人工智能
摘要
权重衰减是一种简单而强大的正则化技术,已广泛用于深度神经网络 (DNNs) 的训练。尽管权重衰减备受关注,先前的研究未能发现由权重衰减引起的大梯度范数方面的一些被忽视的缺陷。在本文中,我们发现权重衰减不幸地会在训练的最终阶段(或终止解)导致大的梯度范数,这通常意味着不良收敛和较差的泛化。为缓解以梯度范数为中心的缺陷,我们提出首个实用的权重衰减调度器,称为调度权重衰减 (SWD) 方法,它可根据梯度范数动态调整权重衰减强度,并在训练期间显著惩罚大梯度范数。我们的实验也支持 SWD 确实缓解了大的梯度范数,并且通常显著优于 Adaptive Moment Estimation (Adam) 的常规恒定权重衰减策略。
引用
@article{arxiv.2011.11152,
title = {On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective},
author = {Zeke Xie and Zhiqiang Xu and Jingzhao Zhang and Issei Sato and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2011.11152},
year = {2024}
}
备注
NeurIPS 2023, 21 pages, 20 figures. Keywords: Weight Decay, Regularization, Optimization, Deep Learning