中文

近似误差为宽度倒数与深度平方根次幂的深层网络

机器学习 2021-03-30 v6 数值分析 数值分析 机器学习

摘要

引入了一种具有超强逼近能力的新网络。该网络在每个神经元中使用 Floor(x\lfloor x\rfloor)或 ReLU(max{0,x}\max\{0,x\})激活函数,因此我们称此类网络为 Floor-ReLU 网络。对于任意超参数 NN+N\in\mathbb{N}^+LN+L\in\mathbb{N}^+,已证明宽度为 max{d,5N+13}\max\{d,\, 5N+13\}、深度为 64dL+364dL+3 的 Floor-ReLU 网络能够以近似误差 3λdα/2NαL3\lambda d^{\alpha/2}N^{-\alpha\sqrt{L}} 一致逼近 [0,1]d[0,1]^d 上的 Hölder 函数 ff,其中 α(0,1]\alpha \in(0,1]λ\lambda 分别为 Hölder 阶和常数。更一般地,对于 [0,1]d[0,1]^d 上连续模为 ωf()\omega_f(\cdot) 的任意连续函数 ff,构造性逼近速率为 ωf(dNL)+2ωf(d)NL\omega_f(\sqrt{d}\,N^{-\sqrt{L}})+2\omega_f(\sqrt{d}){N^{-\sqrt{L}}}。因此,当 ωf(r)\omega_f(r)r0r\to 0 的变化适中时(例如对 Hölder 连续函数有 ωf(r)rα\omega_f(r) \lesssim r^\alpha),这一类新网络克服了逼近能力上的维数灾难,因为我们的逼近速率中要考虑的主要项本质上是 d\sqrt{d} 乘以一个在连续模内与 dd 无关的 NNLL 的函数。

关键词

引用

@article{arxiv.2006.12231,
  title  = {Deep Network with Approximation Error Being Reciprocal of Width to Power of Square Root of Depth},
  author = {Zuowei Shen and Haizhao Yang and Shijun Zhang},
  journal= {arXiv preprint arXiv:2006.12231},
  year   = {2021}
}