中文

学习由单层 ReLU 网络生成的分布

机器学习 2019-09-20 v2 数据结构与算法 统计理论 机器学习 统计理论

摘要

我们考虑从 i.i.d. 样本估计 dd 维校正高斯分布参数的问题。校正高斯分布通过将标准高斯分布经过单层 ReLU 神经网络来定义。我们给出了一个简单算法,使用 O~(1/ϵ2)\tilde{O}(1/\epsilon^2) 个样本和 O~(d2/ϵ2)\tilde{O}(d^2/\epsilon^2) 时间(为简洁忽略对数因子)将参数(即 ReLU 神经网络的权重矩阵和偏置向量)估计至误差 ϵWF\epsilon||W||_F 以内。这意味着我们可以使用 O~(κ2d2/ϵ2)\tilde{O}(\kappa^2d^2/\epsilon^2) 个样本将分布估计至总变差距离 ϵ\epsilon 以内,其中 κ\kappa 为协方差矩阵的条件数。我们唯一的假设是偏置向量非负。若无此非负假设,我们证明在任意误差内估计偏置向量所需的样本数至少是指数级于偏置向量的无穷范数。我们的算法基于向量范数与两两夹角可分别估计这一关键观察。我们使用了近期关于从截断样本学习的结果。我们还证明了两个样本复杂度下界:估计参数至误差 ϵ\epsilon 需要 Ω(1/ϵ2)\Omega(1/\epsilon^2) 个样本,而估计分布至总变差距离 ϵ\epsilon 以内需要 Ω(d/ϵ2)\Omega(d/\epsilon^2) 个样本。第一个下界意味着我们的算法在参数估计上是最优的。最后,我们展示了学习双层生成模型与非负矩阵分解之间的有趣联系。我们提供了实验结果以支持我们的分析。

关键词

引用

@article{arxiv.1909.01812,
  title  = {Learning Distributions Generated by One-Layer ReLU Networks},
  author = {Shanshan Wu and Alexandros G. Dimakis and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:1909.01812},
  year   = {2019}
}

备注

NeurIPS 2019