中文

非凸学习与优化中梯度的均匀收敛性

机器学习 2018-11-13 v2 最优化与控制 机器学习

摘要

我们研究 1) 在标准非凸学习任务中,经验风险的精细性质——特别是梯度——收敛到其总体对应量的速率,以及 2) 这种收敛对优化的影响。我们的分析遵循基于范数的容量控制传统。我们提出向量值 Rademacher 复杂度作为一种简单、可组合且用户友好的工具,以推导非凸学习问题中梯度的无维度均匀收敛界。作为我们技术的应用,我们给出了非凸广义线性模型和非凸鲁棒回归的批量梯度下降方法的新分析,展示了如何使用任何寻找近似驻点的算法来获得最优样本复杂度,即使维度很高或可能为无穷且允许对数据集进行多次遍历。转向非光滑模型,我们表明——与光滑情况相反——即使对于单个 ReLU,在最坏情况下也无法获得梯度的无维度收敛速率。从积极的一面来看,在新的分布假设类型下仍有可能获得无维度速率。

关键词

引用

@article{arxiv.1810.11059,
  title  = {Uniform Convergence of Gradients for Non-Convex Learning and Optimization},
  author = {Dylan J. Foster and Ayush Sekhari and Karthik Sridharan},
  journal= {arXiv preprint arXiv:1810.11059},
  year   = {2018}
}

备注

To appear in Neural Information Processing Systems (NIPS) 2018