超越经验法则:ReLU 网络设计与初始化的缩放演算
机器学习
2022-05-16 v3 机器学习
摘要
我们提出一个用于计算神经网络层与权重“缩放常数”的系统。我们将此缩放常数与两个关乎神经网络可优化性的重要量相关联,并论证通过缩放使所有权重具有相同缩放常数的“预条件化”网络将更易于训练。此缩放演算带来若干推论,其中包括:在初始化神经网络权重方差时,应使用扇入与扇出的几何平均值,而非扇入、扇出或算术平均值。我们的系统允许对 ReLU 神经网络进行离线设计与工程化,有望取代盲目的实验尝试。
引用
@article{arxiv.1906.04267,
title = {Beyond Folklore: A Scaling Calculus for the Design and Initialization of ReLU Networks},
author = {Aaron Defazio and Léon Bottou},
journal= {arXiv preprint arXiv:1906.04267},
year = {2022}
}