学习深度线性神经网络:黎曼梯度流与到全局极小点的收敛
最优化与控制
2020-10-16 v5 机器学习
摘要
我们研究从数据学习深度线性神经网络(激活函数为恒等映射)相关的梯度流的收敛性。在此情形下,网络各层的复合等价于将所有层的权重矩阵相乘,导致一个过参数化问题。关于这些因子的梯度流可被重新解释为秩-r 矩阵流形上赋予适当黎曼度量的黎曼梯度流。我们证明该流总是收敛到 underlying 泛函的临界点。此外,我们确立,对几乎所有初始化,该流收敛到秩 k 矩阵流形上某个 k≤r 的全局最小值。
引用
@article{arxiv.1910.05505,
title = {Learning deep linear neural networks: Riemannian gradient flows and convergence to global minimizers},
author = {Bubacarr Bah and Holger Rauhut and Ulrich Terstiege and Michael Westdickenberg},
journal= {arXiv preprint arXiv:1910.05505},
year = {2020}
}
备注
Minor changes; version accepted for publication in Information and Inference