中文

Maxout 网络的期望梯度及其对参数初始化的影响

机器学习 2023-05-19 v2 机器学习

摘要

我们研究 maxout 网络关于输入与参数的梯度,并获得依赖于网络结构与参数分布的矩的界。我们观察到输入-输出雅可比矩阵的分布依赖于输入,这使稳定的参数初始化变得复杂。基于梯度的矩,我们制定了可避免宽网络中梯度消失与爆炸的参数初始化策略。对深度全连接与卷积网络的实验表明,该策略改善了深度 maxout 网络的 SGD 与 Adam 训练。此外,我们得到了关于线性区域期望数量的精细化界、关于期望曲线长度畸变的结果,以及关于 NTK 的结果。

关键词

引用

@article{arxiv.2301.06956,
  title  = {Expected Gradients of Maxout Networks and Consequences to Parameter Initialization},
  author = {Hanna Tseran and Guido Montúfar},
  journal= {arXiv preprint arXiv:2301.06956},
  year   = {2023}
}

备注

Published at ICML 2023, 42 pages, 11 figures