中文

深度、宽度与初始化的影响:深度线性神经网络分层训练的收敛性分析

机器学习 2020-09-09 v2 数值分析 数值分析 机器学习

摘要

深度神经网络已用于各种机器学习应用并取得了巨大的经验性成功。然而,训练深度神经网络是一项具有挑战性的任务。人们提出了许多替代端到端反向传播的方法。分层训练是其中之一,它一次训练单层,而不是同时训练所有层。在本文中,我们研究了一种使用块坐标梯度下降(BCGD)对深度线性网络进行分层训练的方法。我们建立了 BCGD 的一般收敛性分析,并找到了使损失下降最快的最优学习率。更重要的是,该最优学习率可直接应用于实践,因为它不需要任何先验知识。因此,完全不需要调整学习率。此外,我们明确了深度、宽度和初始化在训练过程中的影响。我们表明,当采用类正交初始化时,只要中间层宽度大于或等于输入和输出维度,其宽度在基于梯度的训练中不发挥作用。我们表明,在某些条件下,网络越深,收敛速度越快越有保障。这意味着,在极端情况下,每个权重矩阵仅更新一次后即达到全局最优。此外,我们发现,即使考虑计算成本,与深度为 1 的网络相比,使用深度网络可大幅加速收敛。我们提供了数值例子来验证我们的理论发现,并展示 BCGD 分层训练的性能。

关键词

引用

@article{arxiv.1910.05874,
  title  = {Effects of Depth, Width, and Initialization: A Convergence Analysis of Layer-wise Training for Deep Linear Neural Networks},
  author = {Yeonjong Shin},
  journal= {arXiv preprint arXiv:1910.05874},
  year   = {2020}
}