关于循环神经网络训练的收敛速率
机器学习
2019-05-28 v4 数据结构与算法
神经与进化计算
最优化与控制
机器学习
摘要
局部搜索方法如随机梯度下降(SGD)如何能在训练多层神经网络时避免糟糕的局部极小?为何即便给定非凸非光滑的架构,它们也能拟合随机标签?现有多数理论仅涵盖单隐藏层网络,那么我们能否分析更深的网络?在本文中,我们关注循环神经网络(RNNs)——一种在自然语言处理中广泛使用的多层网络。它们比前馈神经网络更难分析,因为循环单元在长度为 的整个时间范围内被重复应用,这类似于深度为 的前馈网络。我们表明,当神经元数量足够大,即关于训练数据大小和 为多项式级别时,SGD 能够以线性收敛速率最小化回归损失。这给出了 RNNs 如何记忆数据的理论证据。更重要的是,本文中我们构建了分析带 ReLU 激活的多层网络的通用工具包。例如,我们证明了 ReLU 激活为何能防止指数级梯度爆炸或消失,并建立了扰动理论来分析多层网络的一阶近似。
引用
@article{arxiv.1810.12065,
title = {On the Convergence Rate of Training Recurrent Neural Networks},
author = {Zeyuan Allen-Zhu and Yuanzhi Li and Zhao Song},
journal= {arXiv preprint arXiv:1810.12065},
year = {2019}
}
备注
V2/V3/V4 polish writing