随机梯度下降学习具有非线性激活的状态方程
机器学习
2018-09-11 v1 最优化与控制
机器学习
摘要
我们研究由状态方程 支配的离散时间动力系统。这里 为权重矩阵, 为激活函数, 为输入数据。该关系是循环神经网络(如 LSTMs)的支柱,在序列学习任务中具有广泛应用。我们利用随机梯度下降从有限输入/状态轨迹 中学习权重矩阵。我们证明 SGD 估计在使用了近最优样本量的同时线性收敛到真实权重。我们的结果适用于导数有界远离零的递增激活函数。分析基于 i) 一个具有非线性激活的新颖 SGD 收敛结果,以及 ii) 对状态向量的细致统计刻画。数值实验验证了 SGD 在 ReLU 和 leaky ReLU 上的快速收敛,与我们的理论一致。
引用
@article{arxiv.1809.03019,
title = {Stochastic Gradient Descent Learns State Equations with Nonlinear Activations},
author = {Samet Oymak},
journal= {arXiv preprint arXiv:1809.03019},
year = {2018}
}
备注
23 pages, 4 figures