带 logistic 损失的梯度下降何时能找到插值的两层网络?
机器学习
2021-07-02 v4 机器学习
最优化与控制
摘要
我们研究了使用 logistic 损失对有限宽两层平滑 ReLU 网络进行二分类训练的问题。我们证明,若初始损失足够小,则梯度下降会将训练损失驱动至零。当数据满足特定的聚类和分离条件且网络足够宽时,我们证明一步梯度下降能充分降低损失,从而可应用前述结果。
引用
@article{arxiv.2012.02409,
title = {When does gradient descent with logistic loss find interpolating two-layer networks?},
author = {Niladri S. Chatterji and Philip M. Long and Peter L. Bartlett},
journal= {arXiv preprint arXiv:2012.02409},
year = {2021}
}