基于权重归一化的鲁棒隐式正则化
机器学习
2024-09-18 v4 最优化与控制
摘要
过参数化模型可能具有许多插值解;隐式正则化指的是特定优化方法在众多插值解中隐藏地偏好某一特定插值解。已有确立的一系列工作表明,(随机)梯度下降在训练深度线性网络时往往具有朝向低秩和/或稀疏解的隐式偏置,这在一定程度上解释了为何实践中由梯度下降训练的过参数化神经网络模型往往具有良好的泛化性能。然而,针对平方损失目标的现有理论通常要求可训练权重以极小的初始化尺度开始,这与实践中为更快收敛和更好泛化性能而采用的较大权重初始化尺度相矛盾。本文旨在通过引入并分析带权重归一化的梯度流(梯度下降的连续时间版本)来弥补这一差距,其中权重向量以极坐标重新参数化,并对极坐标施加梯度流。通过分析梯度流的关键不变量并运用 Lojasiewicz 定理,我们证明权重归一化在对角线性模型中也具有朝向稀疏解的隐式偏置,但与普通梯度流不同,权重归一化实现了一种鲁棒的偏置,即便权重以实践中较大的尺度初始化也依然保持。实验表明,在过参数化对角线性网络模型中,使用权重归一化可显著改善隐式偏置在收敛速度和鲁棒性两方面的收益。
引用
@article{arxiv.2305.05448,
title = {Robust Implicit Regularization via Weight Normalization},
author = {Hung-Hsu Chou and Holger Rauhut and Rachel Ward},
journal= {arXiv preprint arXiv:2305.05448},
year = {2024}
}