中文

具有平滑 ReLU 激活的深度网络在逻辑损失下何时通过梯度下降实现插值?

机器学习 2021-07-02 v2 人工智能 机器学习 最优化与控制

摘要

我们建立了将梯度下降应用于固定宽度深度网络时使逻辑损失趋于零的条件,并证明了收敛速率的界。我们的分析适用于 ReLU 的平滑近似,例如先前应用工作中提出的 Swish 和 Huberized ReLU。我们提供了两个充分的收敛条件。第一个仅仅是初始化时损失的界。第二个是先前的分析中使用的数据分离条件。

关键词

引用

@article{arxiv.2102.04998,
  title  = {When does gradient descent with logistic loss interpolate using deep networks with smoothed ReLU activations?},
  author = {Niladri S. Chatterji and Philip M. Long and Peter L. Bartlett},
  journal= {arXiv preprint arXiv:2102.04998},
  year   = {2021}
}