中文

张量程序 I:任意架构的宽前馈或循环神经网络均为高斯过程

神经与进化计算 2021-05-11 v3 无序系统与神经网络 机器学习 数学物理 math.MP

摘要

具有随机权重与偏置的宽神经网络是高斯过程,这最初由 Neal (1995) 观察到,近来 Lee 等人 (2018) 与 Matthews 等人 (2018) 针对深度全连接网络,以及 Novak 等人 (2019) 与 Garriga-Alonso 等人 (2019) 针对深度卷积网络也观察到。我们表明,这种神经网络-高斯过程对应出人意料地扩展到所有由多层感知机、RNNs(如 LSTMs、GRUs)、(n 维或图)卷积、池化、跳跃连接、注意力、批归一化及/或层归一化组成的现代前馈或循环神经网络。更一般地,我们引入一种表达神经网络计算的语言,而我们的结果涵盖所有此类可表达的神经网络。本工作作为 Yang (2019) 中公式化的*张量程序*技术的教程,并阐明了其中获得的高斯过程结果。我们在 github.com/thegregyang/GP4A 提供了简单 RNN、GRU、transformer 以及 batchnorm+ReLU 网络的高斯过程核的开源实现。

关键词

引用

@article{arxiv.1910.12478,
  title  = {Tensor Programs I: Wide Feedforward or Recurrent Neural Networks of Any Architecture are Gaussian Processes},
  author = {Greg Yang},
  journal= {arXiv preprint arXiv:1910.12478},
  year   = {2021}
}

备注

Appearing in NeurIPS 2019; 10 pages of main text; 12 figures, 11 programs; 73 pages total