中文

过参数化神经网络学习的一种函数逼近视角

机器学习 2019-09-04 v2 机器学习

摘要

我们考虑使用梯度下降(GD)方法训练带修正线性单元(ReLU)的过参数化两层神经网络。受近期一系列工作启发,我们研究网络预测误差在 GD 迭代过程中的演化,其可简洁地以矩阵形式描述。当网络充分过参数化时,这些矩阵各自逼近一个仅由特征向量分布 ρ\rho 决定的积分算子。因此,GD 方法可视为对该积分算子在生成响应/标签的底层/目标函数 ff^* 上近似地施加幂运算。我们证明,若 ff^* 关于该积分算子的特征空间存在低秩逼近,则经验风险以仅由 ff^*ρ\rho 决定的线性速率下降到该低秩逼近误差,即该速率与样本量 nn 无关。此外,若 ff^* 的低秩逼近误差为零,则只要神经网络宽度为 Ω(nlogn)\Omega(n\log n),经验风险便下降到 Θ(1/n)\Theta(1/\sqrt{n})。据我们所知,这是首个表明近线性网络过参数化充分性的结果。我们将一般结果应用于 ρ\rho 为球面上均匀分布且 ff^* 为多项式的情形。本文始终考虑输入维度 dd 固定的场景。

关键词

引用

@article{arxiv.1905.10826,
  title  = {On Learning Over-parameterized Neural Networks: A Functional Approximation Perspective},
  author = {Lili Su and Pengkun Yang},
  journal= {arXiv preprint arXiv:1905.10826},
  year   = {2019}
}