中文

最佳 k 层神经网络逼近

机器学习 2019-12-13 v2 机器学习

摘要

我们证明,神经网络的经验风险最小化(ERM)问题一般而言无解。给定训练集 s1,,snRps_1, \dots, s_n \in \mathbb{R}^p 及相应响应 t1,,tnRqt_1,\dots,t_n \in \mathbb{R}^q,拟合一个 kk 层神经网络 νθ:RpRq\nu_\theta : \mathbb{R}^p \to \mathbb{R}^q 涉及通过 ERM 估计权重 θRm\theta \in \mathbb{R}^minfθRm  i=1ntiνθ(si)22. \inf_{\theta \in \mathbb{R}^m} \; \sum_{i=1}^n \lVert t_i - \nu_\theta(s_i) \rVert_2^2. 我们证明,即便对于 k=2k = 2,这一下确界对于 ReLU、双曲正切和 sigmoid 等常见激活函数一般而言也不可达。一个高层次的解释类似于高阶张量的最佳秩-rr 逼近不存在的情形——参数集合不是一个闭集——但最佳 kk 层神经网络逼近所涉及的几何更为微妙。此外,我们证明对于光滑激活 σ(x)=1/(1+exp(x))\sigma(x)= 1/\bigl(1 + \exp(-x)\bigr)σ(x)=tanh(x)\sigma(x)=\tanh(x),这种下确界不可达的情形可发生在具有正测度的响应子集上。对于 ReLU 激活 σ(x)=max(0,x)\sigma(x)=\max(0,x),我们完全分类了最佳两层神经网络逼近的 ERM 达到其下确界的情形。作为附论,我们精确描述了隐层含 dd 个神经元的二层神经网络空间的几何:它是直线与锥的 dd 次割迹的联结轨迹。

关键词

引用

@article{arxiv.1907.01507,
  title  = {Best k-layer neural network approximations},
  author = {Lek-Heng Lim and Mateusz Michalek and Yang Qi},
  journal= {arXiv preprint arXiv:1907.01507},
  year   = {2019}
}

备注

19 pages