中文

带 logistic 损失的梯度下降何时能找到插值的两层网络?

机器学习 2021-07-02 v4 机器学习 最优化与控制

摘要

我们研究了使用 logistic 损失对有限宽两层平滑 ReLU 网络进行二分类训练的问题。我们证明,若初始损失足够小,则梯度下降会将训练损失驱动至零。当数据满足特定的聚类和分离条件且网络足够宽时,我们证明一步梯度下降能充分降低损失,从而可应用前述结果。

关键词

引用

@article{arxiv.2012.02409,
  title  = {When does gradient descent with logistic loss find interpolating two-layer networks?},
  author = {Niladri S. Chatterji and Philip M. Long and Peter L. Bartlett},
  journal= {arXiv preprint arXiv:2012.02409},
  year   = {2021}
}