权重归一化光滑齐次神经网络的梯度下降归纳偏置
机器学习
2023-02-02 v3 机器学习
摘要
我们分析了当以指数损失或交叉熵损失训练时,权重归一化光滑齐次神经网络的梯度下降归纳偏置。我们分析了标准权重归一化(SWN)和指数权重归一化(EWN),并表明采用 EWN 的梯度流路径等价于在标准网络上以自适应学习率进行梯度流。我们将这些结果推广到梯度下降,并建立了 SWN 和 EWN 下权重与梯度的渐近关系。我们还表明,EWN 使权重的更新方式偏好渐近相对稀疏性。对于 EWN,我们给出了梯度流下损失的有限时间收敛速率,以及梯度下降下紧致的渐近收敛速率。我们在合成数据集上展示了 SWN 和 EWN 的结果。在简单数据集上的实验结果支持了我们对稀疏 EWN 解的论断,即便使用 SGD 也是如此。这展示了其在学习易于剪枝的神经网络方面的潜在应用。
引用
@article{arxiv.2010.12909,
title = {Inductive Bias of Gradient Descent for Weight Normalized Smooth Homogeneous Neural Nets},
author = {Depen Morwani and Harish G. Ramaswamy},
journal= {arXiv preprint arXiv:2010.12909},
year = {2023}
}
备注
Accepted to ALT 2022