中文

随机梯度下降学习具有非线性激活的状态方程

机器学习 2018-09-11 v1 最优化与控制 机器学习

摘要

我们研究由状态方程 ht+1=ϕ(Aht+But)h_{t+1}=\phi(Ah_t+Bu_t) 支配的离散时间动力系统。这里 A,BA,B 为权重矩阵,ϕ\phi 为激活函数,utu_t 为输入数据。该关系是循环神经网络(如 LSTMs)的支柱,在序列学习任务中具有广泛应用。我们利用随机梯度下降从有限输入/状态轨迹 (ut,ht)t=0N(u_t,h_t)_{t=0}^N 中学习权重矩阵。我们证明 SGD 估计在使用了近最优样本量的同时线性收敛到真实权重。我们的结果适用于导数有界远离零的递增激活函数。分析基于 i) 一个具有非线性激活的新颖 SGD 收敛结果,以及 ii) 对状态向量的细致统计刻画。数值实验验证了 SGD 在 ReLU 和 leaky ReLU 上的快速收敛,与我们的理论一致。

关键词

引用

@article{arxiv.1809.03019,
  title  = {Stochastic Gradient Descent Learns State Equations with Nonlinear Activations},
  author = {Samet Oymak},
  journal= {arXiv preprint arXiv:1809.03019},
  year   = {2018}
}

备注

23 pages, 4 figures