中文

超越经验法则:ReLU 网络设计与初始化的缩放演算

机器学习 2022-05-16 v3 机器学习

摘要

我们提出一个用于计算神经网络层与权重“缩放常数”的系统。我们将此缩放常数与两个关乎神经网络可优化性的重要量相关联,并论证通过缩放使所有权重具有相同缩放常数的“预条件化”网络将更易于训练。此缩放演算带来若干推论,其中包括:在初始化神经网络权重方差时,应使用扇入与扇出的几何平均值,而非扇入、扇出或算术平均值。我们的系统允许对 ReLU 神经网络进行离线设计与工程化,有望取代盲目的实验尝试。

关键词

引用

@article{arxiv.1906.04267,
  title  = {Beyond Folklore: A Scaling Calculus for the Design and Initialization of ReLU Networks},
  author = {Aaron Defazio and Léon Bottou},
  journal= {arXiv preprint arXiv:1906.04267},
  year   = {2022}
}