中文

一类在遍历数据序列上训练的循环神经网络的核极限

机器学习 2026-01-15 v4 概率论 机器学习

摘要

本文发展数学方法以刻画循环神经网络(RNN)的渐近行为,其中隐藏单元数、序列中数据样本数、隐藏状态更新次数与训练步数同时趋于无穷。针对具有简化权重矩阵的 RNN,我们证明其收敛于一个无限维 ODE 的解,该 ODE 与一随机代数方程的不动点耦合。分析需应对 RNN 特有的若干挑战。在典型平均场应用(如前向神经网络)中,离散更新量为 O(1/N)\mathcal{O}(1/N) 且更新次数为 O(N)\mathcal{O}(N)。因此系统可表示为相应 ODE/PDE 的欧拉近似,当 NN \rightarrow \infty 时收敛于此。然而,RNN 隐藏层更新为 O(1)\mathcal{O}(1)。故 RNN 无法表示为 ODE/PDE 的离散化,标准平均场技术不可直接应用。转而,我们针对 RNN 记忆态演化发展不动点分析,给出依更新步数与隐藏单元数的收敛估计。RNN 隐藏层作为 Sobolev 空间中的函数被研究,其演化由数据序列(马尔可夫链)、参数更新及对其前一时刻隐藏层的依赖所支配。由于更新间强相关,必须使用 Poisson 方程来界定 RNN 围绕其极限方程的涨落。这些数学方法给出了在数据与神经网络规模同时趋于无穷时,于数据序列上训练的 RNN 的神经正切核(NTK)极限。

关键词

引用

@article{arxiv.2308.14555,
  title  = {Kernel Limit for a Class of Recurrent Neural Networks Trained on Ergodic Data Sequences},
  author = {Samuel Chun-Hei Lam and Justin Sirignano and Konstantinos Spiliopoulos},
  journal= {arXiv preprint arXiv:2308.14555},
  year   = {2026}
}

备注

Revision in response to reviewers' comments. The mean-field random function has been replaced by a mean-field term. Some typos fixed. Minor title change