通过景观设计学习单隐层神经网络
机器学习
2017-11-06 v2 数据结构与算法
最优化与控制
机器学习
摘要
我们考虑学习单隐层神经网络的问题:假设输入x∈R^d来自高斯分布,标签y = a^⊤ σ(Bx) + ξ,其中a是R^m中的非负向量且m≤d,B∈R^{m×d}为满秩权重矩阵,ξ为噪声向量。我们首先给出标准平方损失的期望风险的解析公式,并证明它隐式地试图同时分解一系列低秩张量。受该公式启发,我们设计了一个非凸目标函数G(·),其景观保证具有以下性质:1. G的所有局部极小点也是全局极小点。2. G的所有全局极小点对应于真实参数。3. G的值与梯度可利用样本估计。基于这些性质,在G上的随机梯度下降可证明地收敛到全局极小点并学到真实参数。我们还证明了有限样本复杂度结果,并通过仿真验证了这些结果。
引用
@article{arxiv.1711.00501,
title = {Learning One-hidden-layer Neural Networks with Landscape Design},
author = {Rong Ge and Jason D. Lee and Tengyu Ma},
journal= {arXiv preprint arXiv:1711.00501},
year = {2017}
}