扩展深度神经网络:一种容量分配视角
机器学习
2019-03-28 v2 机器学习
摘要
继近期关于容量分配的工作,我们提出猜想:深度神经网络中的破碎问题只有在当层数趋于无穷时容量通过各层的传播具有非退化的连续极限时才可避免。这使我们能够研究若干常用架构,并确定当层数变大时实践中应施加何种缩放关系。特别地,我们恢复了多通道情形下 Xavier 初始化的条件,并发现对于深度残差网络权重与偏置应按层数的平方根之倒数缩放,而对于循环网络应按所需记忆长度的平方根之倒数缩放。
引用
@article{arxiv.1903.04455,
title = {Scaling up deep neural networks: a capacity allocation perspective},
author = {Jonathan Donier},
journal= {arXiv preprint arXiv:1903.04455},
year = {2019}
}
备注
11 pages, 3 figures