以神经元数量刻画深度网络逼近能力
数值分析
2021-01-15 v5 机器学习
数值分析
摘要
本文从神经元数量的角度定量刻画深度前馈神经网络(FNNs)的逼近能力。通过构造证明,宽度为 O ( max { d ⌊ N 1 / d ⌋ , N + 1 } ) \mathcal{O}\big(\max\{d\lfloor N^{1/d}\rfloor,\, N+1\}\big) O ( max { d ⌊ N 1/ d ⌋ , N + 1 } ) 、深度为 O ( L ) \mathcal{O}(L) O ( L ) 的 ReLU FNNs 可以逼近 [ 0 , 1 ] d [0,1]^d [ 0 , 1 ] d 上任意阶为 α ∈ ( 0 , 1 ] \alpha\in (0,1] α ∈ ( 0 , 1 ] 的 Hölder 连续函数,在任意 N , L ∈ N + N,L\in \mathbb{N}^+ N , L ∈ N + 与 p ∈ [ 1 , ∞ ] p\in[1,\infty] p ∈ [ 1 , ∞ ] 下以 L p L^p L p -范数度量的逼近率几乎紧地为 O ( d N − 2 α / d L − 2 α / d ) \mathcal{O}\big(\sqrt{d} N^{-2\alpha/d}L^{-2\alpha/d}\big) O ( d N − 2 α / d L − 2 α / d ) 。更一般地,对于 [ 0 , 1 ] d [0,1]^d [ 0 , 1 ] d 上连续模为 ω f ( ⋅ ) \omega_f(\cdot) ω f ( ⋅ ) 的任意连续函数 f f f ,构造性逼近率为 O ( d ω f ( N − 2 / d L − 2 / d ) ) \mathcal{O}\big(\sqrt{d}\,\omega_f( N^{-2/d}L^{-2/d})\big) O ( d ω f ( N − 2/ d L − 2/ d ) ) 。我们还将分析推广到不规则域上的 f f f ,或那些局部化于 d M d_{\mathcal{M}} d M 维光滑流形 M ⊆ [ 0 , 1 ] d \mathcal{M}\subseteq [0,1]^d M ⊆ [ 0 , 1 ] d (d M ≪ d d_{\mathcal{M}}\ll d d M ≪ d )的 ε \varepsilon ε -邻域中的 f f f 。特别地,在本质低维域的情形,我们给出 ReLU FNNs 在 ε \varepsilon ε -邻域中逼近 f f f 的逼近率 O ( ω f ( ε 1 − δ d d δ + ε ) + d ω f ( d ( 1 − δ ) d δ N − 2 / d δ L − 2 / d δ ) ) \mathcal{O}\big(\omega_f(\tfrac{\varepsilon}{1-\delta}\sqrt{\tfrac{d}{d_\delta}}+\varepsilon)+\sqrt{d}\,\omega_f(\tfrac{\sqrt{d}}{(1-\delta)\sqrt{d_\delta}}N^{-2/d_\delta}L^{-2/d_\delta})\big) O ( ω f ( 1 − δ ε d δ d + ε ) + d ω f ( ( 1 − δ ) d δ d N − 2/ d δ L − 2/ d δ ) ) ,其中对任意 δ ∈ ( 0 , 1 ) \delta\in(0,1) δ ∈ ( 0 , 1 ) ,当将 M \mathcal{M} M 投影到 d δ d_{\delta} d δ 维域时作为近似等距投影的相对误差有 d δ = O ( d M ln ( d / δ ) δ 2 ) d_\delta=\mathcal{O}\big(d_{\mathcal{M}}\tfrac{\ln (d/\delta)}{\delta^2}\big) d δ = O ( d M δ 2 l n ( d / δ ) ) 。
引用
@article{arxiv.1906.05497,
title = {Deep Network Approximation Characterized by Number of Neurons},
author = {Zuowei Shen and Haizhao Yang and Shijun Zhang},
journal= {arXiv preprint arXiv:1906.05497},
year = {2021}
}