中文

用过参数化循环神经网络学习低维状态空间

机器学习 2023-03-24 v3

摘要

深度学习中的过参数化通常指这样一种情形:训练好的神经网络(NN)具有以多种方式拟合训练数据的表示能力,其中某些方式泛化良好,而另一些则不然。在循环神经网络(RNNs)的情形中,存在额外一层的过参数化,即一个模型可能展现出许多在训练所见序列长度上泛化良好的解,其中一些可外推至更长序列,而另一些则不能。大量工作研究了梯度下降(GD)拟合过参数化 NN 以获得泛化良好解的趋势。另一方面,其拟合过参数化 RNN 以获得可外推解的趋势直至最近才被发现,且远未被充分理解。本文中,我们分析 GD 应用于过参数化线性 RNN 时的外推性质。与近期暗示偏向短期记忆的隐式偏置的论点相反,我们提供学习低维状态空间的理论证据,其亦可建模长期记忆。我们的结果依赖于一种动力学刻画,表明 GD(小步长且近零初始化)力求维持某种形式的平衡性,以及依赖于统计学中矩问题(由矩恢复概率分布)背景下发展的工具。实验佐证了我们的理论,展示了通过线性与非线性 RNN 学习低维状态空间实现外推。

关键词

引用

@article{arxiv.2210.14064,
  title  = {Learning Low Dimensional State Spaces with Overparameterized Recurrent Neural Nets},
  author = {Edo Cohen-Karlik and Itamar Menuhin-Gruman and Raja Giryes and Nadav Cohen and Amir Globerson},
  journal= {arXiv preprint arXiv:2210.14064},
  year   = {2023}
}

备注

Accepted to ICLR 2023, 9 pages, 2 figures plus supplementary