中文

基于梯度下降的单神经元不可知学习

机器学习 2020-09-01 v3 最优化与控制 机器学习

摘要

我们考虑如下问题:通过使用梯度下降最小化由一组 i.i.d.i.i.d. 样本 SDnS\sim \mathcal{D}^n 导出的经验风险,学习以期望平方损失 E(x,y)D[(σ(wx)y)2]\mathbb{E}_{(x,y)\sim \mathcal{D}}[(\sigma(w^\top x)-y)^2] 衡量的最佳拟合单神经元,其中期望基于某个未知的联合分布 D\mathcal{D}。激活函数 σ\sigma 是任意的Lipschitz非递减函数,使得该优化问题通常是非凸且非光滑的,并涵盖了典型的神经网络激活函数以及广义线性模型设定中的逆链接函数。在不可知PAC学习设定中,即不对标签 yy 和输入 xx 之间的关系做任何假设,若最优总体风险为 OPT\mathsf{OPT},我们证明当 σ\sigma 严格递增时,梯度下降在多项式时间和样本复杂度内达到总体风险 O(OPT)+ϵO(\mathsf{OPT})+\epsilon。对于ReLU激活,我们的总体风险保证为 O(OPT1/2)+ϵO(\mathsf{OPT}^{1/2})+\epsilon。当标签形式为 y=σ(vx)+ξy = \sigma(v^\top x) + \xi,其中 ξ\xi 为零均值次高斯噪声时,我们证明梯度下降的总体风险保证提升至 OPT+ϵ\mathsf{OPT} + \epsilon。我们的样本复杂度和运行时间保证(几乎)与维度无关,且当 σ\sigma 严格递增时,除有界性外无需任何分布假设。对于ReLU,我们在输入边缘分布的非退化假设下展示了相同的结果。

关键词

引用

@article{arxiv.2005.14426,
  title  = {Agnostic Learning of a Single Neuron with Gradient Descent},
  author = {Spencer Frei and Yuan Cao and Quanquan Gu},
  journal= {arXiv preprint arXiv:2005.14426},
  year   = {2020}
}

备注

31 pages, 3 tables. This version improves the risk bound from O(OPT^1/2) to O(OPT) for strictly increasing activation functions