中文

学习深度线性神经网络:黎曼梯度流与到全局极小点的收敛

最优化与控制 2020-10-16 v5 机器学习

摘要

我们研究从数据学习深度线性神经网络(激活函数为恒等映射)相关的梯度流的收敛性。在此情形下,网络各层的复合等价于将所有层的权重矩阵相乘,导致一个过参数化问题。关于这些因子的梯度流可被重新解释为秩-r 矩阵流形上赋予适当黎曼度量的黎曼梯度流。我们证明该流总是收敛到 underlying 泛函的临界点。此外,我们确立,对几乎所有初始化,该流收敛到秩 k 矩阵流形上某个 k≤r 的全局最小值。

关键词

引用

@article{arxiv.1910.05505,
  title  = {Learning deep linear neural networks: Riemannian gradient flows and convergence to global minimizers},
  author = {Bubacarr Bah and Holger Rauhut and Ulrich Terstiege and Michael Westdickenberg},
  journal= {arXiv preprint arXiv:1910.05505},
  year   = {2020}
}

备注

Minor changes; version accepted for publication in Information and Inference