中文

面向理解神经网络在初始训练阶段的凝聚现象

机器学习 2022-10-20 v6 人工智能

摘要

实证研究表明,对于小初始化的 ReLU 神经网络(NNs),隐藏神经元的输入权重(隐藏神经元的输入权重由其输入层到该隐藏神经元的权重及其偏置项组成)会凝聚在孤立的取向上。该凝聚动力学意味着训练隐式地将神经网络正则化为一个有效规模小得多的网络。在本工作中,我们阐明了多层全连接神经网络中凝聚现象的形成,并表明在初始训练阶段凝聚取向的最大数量是激活函数重数(multiplicity)的两倍,其中“重数”表示激活函数在原点处的多重根。我们的理论分析证实了两种情况下的实验:一种是针对任意维度输入的、重数为一的激活函数(包含许多常见激活函数),另一种是针对一维输入且任意重数的层。本工作为理解小初始化如何在初始训练阶段导致神经网络凝聚迈出了一步。

关键词

引用

@article{arxiv.2105.11686,
  title  = {Towards Understanding the Condensation of Neural Networks at Initial Training},
  author = {Hanxu Zhou and Qixuan Zhou and Tao Luo and Yaoyu Zhang and Zhi-Qin John Xu},
  journal= {arXiv preprint arXiv:2105.11686},
  year   = {2022}
}