中文

更深层仅在浅层良好时才更优吗?

机器学习 2019-03-11 v1 机器学习

摘要

理解前馈神经网络中深度的能力是深度学习理论领域中的一个持续挑战。虽然当前工作解释了深度对神经网络表达力的重要性,但这些优势是否在基于梯度的优化过程中被利用仍是一个开放问题。本文中我们探讨了深度网络的表达性质与使用基于梯度的算法高效训练它们的能力之间的关系。我们给出了具有分形结构的分布的深度分离论证,表明它们可以被深度网络高效表达,而不能被浅层网络表达。这些分布具有自然的由粗到细的结构,并且我们展示了粗粒度与细粒度细节之间的平衡对优化过程是否可能成功有关键影响。我们证明当分布集中于细粒度细节时,基于梯度的算法很可能失败。利用该结果我们证明,至少在某些分布下,学习深度网络的成功取决于该分布是否能被更浅的网络很好地近似,并我们猜想该性质在一般情况下成立。

关键词

引用

@article{arxiv.1903.03488,
  title  = {Is Deeper Better only when Shallow is Good?},
  author = {Eran Malach and Shai Shalev-Shwartz},
  journal= {arXiv preprint arXiv:1903.03488},
  year   = {2019}
}