过参数化神经网络学习的一种函数逼近视角
机器学习
2019-09-04 v2 机器学习
摘要
我们考虑使用梯度下降(GD)方法训练带修正线性单元(ReLU)的过参数化两层神经网络。受近期一系列工作启发,我们研究网络预测误差在 GD 迭代过程中的演化,其可简洁地以矩阵形式描述。当网络充分过参数化时,这些矩阵各自逼近一个仅由特征向量分布 决定的积分算子。因此,GD 方法可视为对该积分算子在生成响应/标签的底层/目标函数 上近似地施加幂运算。我们证明,若 关于该积分算子的特征空间存在低秩逼近,则经验风险以仅由 和 决定的线性速率下降到该低秩逼近误差,即该速率与样本量 无关。此外,若 的低秩逼近误差为零,则只要神经网络宽度为 ,经验风险便下降到 。据我们所知,这是首个表明近线性网络过参数化充分性的结果。我们将一般结果应用于 为球面上均匀分布且 为多项式的情形。本文始终考虑输入维度 固定的场景。
引用
@article{arxiv.1905.10826,
title = {On Learning Over-parameterized Neural Networks: A Functional Approximation Perspective},
author = {Lili Su and Pengkun Yang},
journal= {arXiv preprint arXiv:1905.10826},
year = {2019}
}