中文

论层归一化的非线性

机器学习 2024-06-04 v1 人工智能

摘要

层归一化(LN)是深度学习中一种普遍使用的技术,但我们对它的理论理解仍然难以捉摸。本文探讨了LN的一个新理论方向,涉及其非线性和表示能力。我们研究了由线性变换和LN变换逐层组合而成的网络(称为LN-Net)的表示能力。我们从理论上证明,给定mm个具有任意标签分配的样本,一个每层仅有3个神经元、包含O(m)O(m)个LN层的LN-Net能够正确分类它们。我们进一步给出了LN-Net的VC维下界。LN的非线性可以通过分组划分来放大,这一点在温和假设下得到了理论证明,并得到了我们实验的实证支持。基于我们的分析,我们考虑通过利用和放大LN的非线性来设计神经架构,其有效性得到了我们实验的支持。

关键词

引用

@article{arxiv.2406.01255,
  title  = {On the Nonlinearity of Layer Normalization},
  author = {Yunhao Ni and Yuxin Guo and Junlong Jia and Lei Huang},
  journal= {arXiv preprint arXiv:2406.01255},
  year   = {2024}
}

备注

42 pages, accepted to ICML 2024