中文

通过梯度下降学习 ReLU

机器学习 2017-08-03 v2 信息论 math.IT 最优化与控制 机器学习

摘要

本文研究学习修正线性单元(Rectified Linear Units, ReLU)的问题,这些单元是形如 max(0,<w,x>)max(0,<w,x>) 的函数,其中 ww 表示权重向量。我们在观测数量少于权重向量维度的高维情形下研究此问题。我们假设权重向量属于某个闭集(凸或非凸),该集合捕获了关于其结构的已知边信息。我们关注可实现模型,其中输入从高斯分布中独立同分布选取,标签根据植入的权重向量生成。我们证明,当初始化为 0 时,投影梯度下降以线性速率收敛到植入模型,且所需样本数量在数值常数范围内是最优的。我们对这些极浅神经网络收敛动力学的研究结果,可能为理解更深架构的动力学提供一些见解。

关键词

引用

@article{arxiv.1705.04591,
  title  = {Learning ReLUs via Gradient Descent},
  author = {Mahdi Soltanolkotabi},
  journal= {arXiv preprint arXiv:1705.04591},
  year   = {2017}
}

备注

arXiv admin note: text overlap with arXiv:1702.06175