中文

权重归一化光滑齐次神经网络的梯度下降归纳偏置

机器学习 2023-02-02 v3 机器学习

摘要

我们分析了当以指数损失或交叉熵损失训练时,权重归一化光滑齐次神经网络的梯度下降归纳偏置。我们分析了标准权重归一化(SWN)和指数权重归一化(EWN),并表明采用 EWN 的梯度流路径等价于在标准网络上以自适应学习率进行梯度流。我们将这些结果推广到梯度下降,并建立了 SWN 和 EWN 下权重与梯度的渐近关系。我们还表明,EWN 使权重的更新方式偏好渐近相对稀疏性。对于 EWN,我们给出了梯度流下损失的有限时间收敛速率,以及梯度下降下紧致的渐近收敛速率。我们在合成数据集上展示了 SWN 和 EWN 的结果。在简单数据集上的实验结果支持了我们对稀疏 EWN 解的论断,即便使用 SGD 也是如此。这展示了其在学习易于剪枝的神经网络方面的潜在应用。

关键词

引用

@article{arxiv.2010.12909,
  title  = {Inductive Bias of Gradient Descent for Weight Normalized Smooth Homogeneous Neural Nets},
  author = {Depen Morwani and Harish G. Ramaswamy},
  journal= {arXiv preprint arXiv:2010.12909},
  year   = {2023}
}

备注

Accepted to ALT 2022