中文

以神经元数量刻画深度网络逼近能力

数值分析 2021-01-15 v5 机器学习 数值分析

摘要

本文从神经元数量的角度定量刻画深度前馈神经网络(FNNs)的逼近能力。通过构造证明,宽度为 O(max{dN1/d,N+1})\mathcal{O}\big(\max\{d\lfloor N^{1/d}\rfloor,\, N+1\}\big)、深度为 O(L)\mathcal{O}(L) 的 ReLU FNNs 可以逼近 [0,1]d[0,1]^d 上任意阶为 α(0,1]\alpha\in (0,1] 的 Hölder 连续函数,在任意 N,LN+N,L\in \mathbb{N}^+p[1,]p\in[1,\infty] 下以 LpL^p-范数度量的逼近率几乎紧地为 O(dN2α/dL2α/d)\mathcal{O}\big(\sqrt{d} N^{-2\alpha/d}L^{-2\alpha/d}\big)。更一般地,对于 [0,1]d[0,1]^d 上连续模为 ωf()\omega_f(\cdot) 的任意连续函数 ff,构造性逼近率为 O(dωf(N2/dL2/d))\mathcal{O}\big(\sqrt{d}\,\omega_f( N^{-2/d}L^{-2/d})\big)。我们还将分析推广到不规则域上的 ff,或那些局部化于 dMd_{\mathcal{M}} 维光滑流形 M[0,1]d\mathcal{M}\subseteq [0,1]^ddMdd_{\mathcal{M}}\ll d)的 ε\varepsilon-邻域中的 ff。特别地,在本质低维域的情形,我们给出 ReLU FNNs 在 ε\varepsilon-邻域中逼近 ff 的逼近率 O(ωf(ε1δddδ+ε)+dωf(d(1δ)dδN2/dδL2/dδ))\mathcal{O}\big(\omega_f(\tfrac{\varepsilon}{1-\delta}\sqrt{\tfrac{d}{d_\delta}}+\varepsilon)+\sqrt{d}\,\omega_f(\tfrac{\sqrt{d}}{(1-\delta)\sqrt{d_\delta}}N^{-2/d_\delta}L^{-2/d_\delta})\big),其中对任意 δ(0,1)\delta\in(0,1),当将 M\mathcal{M} 投影到 dδd_{\delta} 维域时作为近似等距投影的相对误差有 dδ=O(dMln(d/δ)δ2)d_\delta=\mathcal{O}\big(d_{\mathcal{M}}\tfrac{\ln (d/\delta)}{\delta^2}\big)

关键词

引用

@article{arxiv.1906.05497,
  title  = {Deep Network Approximation Characterized by Number of Neurons},
  author = {Zuowei Shen and Haizhao Yang and Shijun Zhang},
  journal= {arXiv preprint arXiv:1906.05497},
  year   = {2021}
}