中文

面向极小化子:过参数化问题中SGD的快速收敛

机器学习 2023-06-06 v1 最优化与控制 机器学习

摘要

现代机器学习范式,如深度学习,发生在或接近插值机制,其中模型参数数量远大于数据样本数量。在本工作中,我们在插值机制内提出一个正则条件,使随机梯度法具备与确定性梯度法相同的最坏情况迭代复杂度,同时每次迭代仅使用单个采样梯度(或小批量)。相比之下,所有现有保证都要求随机梯度法采取小步长,从而导致慢得多的线性收敛速率。最后,我们证明当训练具有线性输出层的足够宽前馈神经网络时,我们的条件成立。

关键词

引用

@article{arxiv.2306.02601,
  title  = {Aiming towards the minimizers: fast convergence of SGD for overparametrized problems},
  author = {Chaoyue Liu and Dmitriy Drusvyatskiy and Mikhail Belkin and Damek Davis and Yi-An Ma},
  journal= {arXiv preprint arXiv:2306.02601},
  year   = {2023}
}