中文

无限宽三层神经网络的经验相图

机器学习 2022-10-20 v2 人工智能

摘要

大量工作表明神经网络(NNs)的动力学与其参数初始化密切相关。受无限宽两层ReLU神经网络相图(Luo et al., 2021)的启发,我们向绘制无限宽三层ReLU神经网络的相图迈出了一步。首先,我们推导了三层ReLU神经网络的归一化梯度流,并获得了两个关键的独立量来区分常见初始化方法的不同动力学机制。通过精心设计的实验和巨大的计算代价,在合成数据集和真实数据集上,我们发现每一层的动力学同样可划分为线性机制和凝聚机制,并由临界机制分隔。判据为训练过程中当宽度趋于无穷时输入权重的相对变化(隐藏神经元的输入权重由其输入层到该隐藏神经元的权重及其偏置项组成),其分别趋于00++\inftyO(1)O(1)。此外,我们还证明在深度神经网络的训练过程中,不同层可处于不同的动力学机制。在凝聚机制中,我们还观察到权重在低复杂度孤立方向上的凝聚。通过三层条件下的实验,我们的相图揭示了一个由三种可能机制及其混合构成的复杂动力学机制,为深度神经网络在不同初始化机制下的研究提供了指导,并揭示了深度神经网络不同层出现完全不同动力学的可能性。

关键词

引用

@article{arxiv.2205.12101,
  title  = {Empirical Phase Diagram for Three-layer Neural Networks with Infinite Width},
  author = {Hanxu Zhou and Qixuan Zhou and Zhenyuan Jin and Tao Luo and Yaoyu Zhang and Zhi-Qin John Xu},
  journal= {arXiv preprint arXiv:2205.12101},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2007.07497