循环神经网络梯度下降的收敛性:非渐近分析
机器学习
2024-10-11 v2 最优化与控制
机器学习
摘要
我们分析了具有对角隐藏层到隐藏层权重矩阵的循环神经网络,这些网络在监督学习设置下使用梯度下降进行训练,并证明了梯度下降可以在没有大规模过参数化的情况下实现最优性。我们深入的非渐近分析(i)提供了关于网络规模 的改进界限,该界限取决于序列长度 、样本量 和环境维度 ;(ii)确定了动力系统中长期依赖性对收敛性和网络宽度界限的显著影响,这种影响由一个取决于激活函数 Lipschitz 连续性的截止点表征。值得注意的是,该分析表明,适当初始化的循环神经网络在使用 个样本训练时,可以实现最优性,其网络规模 仅随 呈对数缩放。这与先前工作要求 对 具有高阶多项式依赖以建立强正则性条件形成了鲜明对比。我们的结果基于对可通过范数约束传输映射近似和学习的动力系统类别的显式刻画,并建立了隐藏状态关于可学习参数的局部平滑性质。
引用
@article{arxiv.2402.12241,
title = {Convergence of Gradient Descent for Recurrent Neural Networks: A Nonasymptotic Analysis},
author = {Semih Cayci and Atilla Eryilmaz},
journal= {arXiv preprint arXiv:2402.12241},
year = {2024}
}