PathProx:一种用于权重衰减正则化深度神经网络近端梯度算法
机器学习
2023-07-07 v4
摘要
权重衰减是深度学习中应用最广泛的正则化形式之一,已被证明能够改善泛化能力和鲁棒性。驱动权重衰减的优化目标为损失之和加上一项与权重平方和成正比的项。本文认为,随机梯度下降(SGD)对于该目标可能是一种低效的算法。对于具有 ReLU 激活函数的神经网络,权重衰减目标的解等价于另一目标的解,在后一目标中正则化项改为与每个 ReLU 神经元相关的输入和输出权重的 (非平方)范数乘积之和。这一替代(且实际等价)的正则化启发了一种新颖的用于网络训练的近端梯度算法。理论与实验均支持这一新训练方法,表明其能够比标准权重衰减训练更快地收敛到其所共有的稀疏解。
引用
@article{arxiv.2210.03069,
title = {PathProx: A Proximal Gradient Algorithm for Weight Decay Regularized Deep Neural Networks},
author = {Liu Yang and Jifan Zhang and Joseph Shenouda and Dimitris Papailiopoulos and Kangwook Lee and Robert D. Nowak},
journal= {arXiv preprint arXiv:2210.03069},
year = {2023}
}