中文

深度学习、随机梯度下降与扩散映射

机器学习 2022-06-20 v3 机器学习

摘要

随机梯度下降(SGD)因其计算效率在深度学习中得到广泛应用,但对 SGD 为何表现如此良好的完整理解仍是一项重大挑战。经验观察到,过参数化深度神经网络损失景观上损失函数 Hessian 矩阵的大部分特征值接近于零,而仅有少量特征值较大。零特征值表明沿相应方向的扩散为零。这表明极小值选择过程主要发生在对应于 Hessian 矩阵最大特征值的相对低维子空间中。尽管参数空间非常高维,这些发现似乎表明 SGD 动力学可能主要存在于低维流形上。在本文中,我们采用真正数据驱动的方法来处理问题,以潜在更深入地理解高维参数曲面,特别是通过分析 SGD 或任何其他优化器所生成的数据,来探究 SGD 所迹出的景观,从而可能发现优化景观的(局部)低维表示。作为探索工具,我们使用由 R. Coifman 及其合作者引入的扩散映射。

关键词

引用

@article{arxiv.2204.01365,
  title  = {Deep learning, stochastic gradient descent and diffusion maps},
  author = {Carmina Fjellström and Kaj Nyström},
  journal= {arXiv preprint arXiv:2204.01365},
  year   = {2022}
}