中文

紧域上ReLU网络通用逼近的最小宽度

机器学习 2024-03-06 v2 机器学习

摘要

已有研究表明,宽度足够大的深度神经网络是通用逼近器,但宽度过小时则不是。已有若干尝试刻画能实现通用逼近性质的最小宽度 wminw_{\min};然而,仅有少数找到了精确值。本文中,我们证明:当激活函数为类ReLU函数(如ReLU、GELU、Softplus)时,从 [0,1]dx[0,1]^{d_x}Rdy\mathbb R^{d_y}LpL^p 函数之 LpL^p 逼近的最小宽度恰为 max{dx,dy,2}\max\{d_x,d_y,2\}。与已知的ReLU网络结果(当定义域为 Rdx\smash{\mathbb R^{d_x}}wmin=max{dx+1,dy}w_{\min}=\max\{d_x+1,d_y\})相比,我们的结果首次表明紧域上的逼近所需宽度小于 Rdx\smash{\mathbb R^{d_x}} 上的逼近。接着,我们证明了使用含ReLU的一般激活函数进行一致逼近时 wminw_{\min} 的下界:若 dx<dy2dxd_x<d_y\le2d_x,则 wmindy+1w_{\min}\ge d_y+1。结合我们的首个结果,这显示了对于一般激活函数及输入/输出维度,LpL^p 逼近与一致逼近之间的二分性。

关键词

引用

@article{arxiv.2309.10402,
  title  = {Minimum width for universal approximation using ReLU networks on compact domain},
  author = {Namjun Kim and Chanho Min and Sejun Park},
  journal= {arXiv preprint arXiv:2309.10402},
  year   = {2024}
}