中文

ReLU网络在宽度与深度意义上的最优逼近率

机器学习 2021-12-15 v5 机器学习

摘要

本文关注深度前馈神经网络在宽度与深度意义上的逼近能力。通过构造证明,宽度为O(max{dN1/d,N+2})\mathcal{O}\big(\max\{d\lfloor N^{1/d}\rfloor,\, N+2\}\big)、深度为O(L)\mathcal{O}(L)的ReLU网络能够以逼近率O(λd(N2L2lnN)α/d)\mathcal{O}\big(\lambda\sqrt{d} (N^2L^2\ln N)^{-\alpha/d}\big)逼近[0,1]d[0,1]^d上的Hölder连续函数,其中α(0,1]\alpha\in (0,1]λ>0\lambda>0分别为Hölder阶与常数。该速率在宽度和深度各自意义上除常数外是最优的,而现有结果仅在不含逼近率中对数因子的意义下近最优。更一般地,对于[0,1]d[0,1]^d上任意连续函数ff,逼近率变为O(dωf((N2L2lnN)1/d))\mathcal{O}\big(\,\sqrt{d}\,\omega_f\big( (N^2L^2\ln N)^{-1/d}\big)\,\big),其中ωf()\omega_f(\cdot)为连续模。我们还将分析扩展到有界集上的任意连续函数ff。特别地,若使用深度3131、宽度O(N)\mathcal{O}(N)的ReLU网络逼近[0,1][0,1]上Lipschitz常数为λ>0\lambda>0的一维Lipschitz连续函数,则就总参数量W=O(N2)W=\mathcal{O}(N^2)而言的逼近率变为O(λWlnW)\mathcal{O}(\tfrac{\lambda}{W\ln W}),这在固定深度ReLU网络的文献中尚未被发现。

关键词

引用

@article{arxiv.2103.00502,
  title  = {Optimal Approximation Rate of ReLU Networks in terms of Width and Depth},
  author = {Zuowei Shen and Haizhao Yang and Shijun Zhang},
  journal= {arXiv preprint arXiv:2103.00502},
  year   = {2021}
}