中文

计算矩阵平方根的非凸梯度下降的全局收敛性

数值分析 2017-03-10 v2 数据结构与算法 数值分析 最优化与控制

摘要

尽管近年来有大量研究非凸优化问题中梯度下降技术的工作,但对于许多感兴趣的问题,所有现有结果要么建立了具有良好速率的局部收敛,要么建立了具有高度次优速率的全局收敛。在本文中,我们朝着兼得两者优势迈出了第一步——为计算正定(PD)矩阵平方根这一在数值线性代数中被广泛研究且在机器学习与统计等领域有应用的问题,建立全局收敛并获得良好的收敛速率。给定PD矩阵MM和PD起点U0U_0,我们证明步长适当选择的梯度下降在O(αlog(MU02F/ϵ))O(\alpha \log (\|M-U_0^2\|_F /\epsilon))次迭代中找到MM的一个ϵ\epsilon精度平方根,其中α=(max{U022,M2}/min{σmin2(U0),σmin(M)})3/2\alpha = (\max\{\|U_0\|_2^2,\|M\|_2\} / \min \{\sigma_{\min}^2(U_0),\sigma_{\min}(M) \} )^{3/2}。我们的结果是首个为该问题建立全局收敛且对每次迭代中的误差具有鲁棒性的结果。我们工作的一个关键贡献是一般的证明技术,我们相信它应进一步激发对机器学习与数值线性代数中其他问题的简单非凸梯度下降算法的确定性和随机变体及其良好全局收敛速率的研究。

关键词

引用

@article{arxiv.1507.05854,
  title  = {Global Convergence of Non-Convex Gradient Descent for Computing Matrix Squareroot},
  author = {Prateek Jain and Chi Jin and Sham M. Kakade and Praneeth Netrapalli},
  journal= {arXiv preprint arXiv:1507.05854},
  year   = {2017}
}

备注

Appear in AISTATS 2017