中文

利用深度核整形在无跳跃连接或归一化层情况下快速训练深度神经网络

机器学习 2021-10-06 v1 人工智能 神经与进化计算

摘要

利用Poole等人(2016)的Q/C映射分析的扩展与形式化版本,以及神经切线核(Neural Tangent Kernel)理论,我们识别出阻碍深度网络快速训练并泛化到未见过数据的主要病理现象,并展示如何通过仔细控制网络初始化时核函数的“形状”来避免这些问题。随后我们开发了一种称为深度核整形(DKS)的方法,它结合精确的参初始化、激活函数变换和小的架构调整来实现这一点,且所有这些均保持模型类。在我们的实验中,我们展示DKS能够在ImageNet和CIFAR-10分类任务上以与标准ResNetV2和Wide-ResNet模型相当的速度,使用SGD训练无归一化层的残差网络,仅泛化性能有小幅下降。而当使用K-FAC作为优化器时,我们在无跳跃连接的网络上也取得了类似结果。我们的结果适用于大量激活函数,包括传统上表现非常差的如logistic sigmoid。除DKS外,我们还贡献了对跳跃连接、归一化层、如RELU和SELU的特殊激活函数以及各种初始化方案的详细分析,解释它们作为“整形”网络初始化时核的替代(且最终不完整的)方式的有效性。

关键词

引用

@article{arxiv.2110.01765,
  title  = {Rapid training of deep neural networks without skip connections or normalization layers using Deep Kernel Shaping},
  author = {James Martens and Andy Ballard and Guillaume Desjardins and Grzegorz Swirszcz and Valentin Dalibard and Jascha Sohl-Dickstein and Samuel S. Schoenholz},
  journal= {arXiv preprint arXiv:2110.01765},
  year   = {2021}
}