中文

基于深度 ReLU 神经网络的分段光滑函数最优逼近

泛函分析 2018-05-23 v4 机器学习 机器学习

摘要

我们研究了 ReLU 神经网络在深度和权重数量方面逼近 L2L^2 中分类器函数所需的必要且充分复杂度。作为一个模型类,我们考虑可能不连续的分段 CβC^\beta 函数 f:[1/2,1/2]dRf : [-1/2, 1/2]^d \to \mathbb R 的集合 Eβ(Rd)\mathcal{E}^\beta (\mathbb R^d),其中 ff 的不同光滑区域由 CβC^\beta 超曲面分隔。对于维度 d2d \geq 2、正则性 β>0\beta > 0 和精度 ε>0\varepsilon > 0,我们构造了具有 ReLU 激活函数的人工神经网络,将 Eβ(Rd)\mathcal{E}^\beta(\mathbb R^d) 中的函数逼近到 L2L^2 误差为 ε\varepsilon。所构造的网络具有仅依赖于 ddβ\beta 的固定层数,并且具有 O(ε2(d1)/β)O(\varepsilon^{-2(d-1)/\beta}) 个非零权重,我们证明这是最优的。除了权重数量的最优性外,我们表明为了达到最优逼近速率,需要具有一定深度的 ReLU 网络。确切地说,对于分段 Cβ(Rd)C^\beta(\mathbb R^d) 函数,该最小深度——至多相差一个乘法常数——由 β/d\beta/d 给出。除一个对数因子外,我们构造的网络匹配此界。这通过表明深度网络对于实现(分段)光滑函数的高效逼近是必要的,部分解释了 ReLU 网络深度的益处。最后,我们分析了高维空间中的逼近,其中待逼近函数 ff 可分解为光滑的降维特征映射 τ\tau 和定义在低维特征空间上的分类器函数 gg——即 f=gτf = g \circ \tau。我们表明在这种情况下逼近速率仅依赖于特征空间的维度而非输入维度。

关键词

引用

@article{arxiv.1709.05289,
  title  = {Optimal approximation of piecewise smooth functions using deep ReLU neural networks},
  author = {Philipp Petersen and Felix Voigtlaender},
  journal= {arXiv preprint arXiv:1709.05289},
  year   = {2018}
}

备注

Generalized some estimates to $L^p$ norms for $0<p<\infty$