中文

超越宽度与深度的神经网络架构

机器学习 2023-03-24 v4 机器学习

摘要

本文通过引入除宽度和深度之外的称为高度的额外维度,提出了一种新的神经网络架构。以高度、宽度和深度为超参数的神经网络架构被称为三维架构。研究表明,具有三维架构的神经网络比二维架构(那些仅以宽度和深度为超参数的架构,例如标准全连接网络)的神经网络具有显著更强的表达能力。新网络架构通过嵌套结构递归构建,因此我们将具有该新架构的网络称为嵌套网络(NestNet)。高度为 ss 的 NestNet 由每个隐藏神经元经高度 s1\le s-1 的 NestNet 激活而构建。当 s=1s=1 时,NestNet 退化为具有二维架构的标准网络。通过构造证明,具有 O(n)\mathcal{O}(n) 参数的高度-ss ReLU NestNet 可以在 [0,1]d[0,1]^d 上以误差 O(n(s+1)/d)\mathcal{O}(n^{-(s+1)/d}) 逼近 11-Lipschitz 连续函数,而具有 O(n)\mathcal{O}(n) 参数的标准 ReLU 网络的最优逼近误差为 O(n2/d)\mathcal{O}(n^{-2/d})。此外,该结果被推广到 [0,1]d[0,1]^d 上的通用连续函数,其逼近误差由连续模刻画。最后,我们通过数值实验展示了 ReLU NestNet 的超逼近能力的优势。

关键词

引用

@article{arxiv.2205.09459,
  title  = {Neural Network Architecture Beyond Width and Depth},
  author = {Zuowei Shen and Haizhao Yang and Shijun Zhang},
  journal= {arXiv preprint arXiv:2205.09459},
  year   = {2023}
}