梯度下降与幂法:利用二者联系求最左特征对并逃离鞍点
最优化与控制
2022-11-03 v1 机器学习
摘要
本工作表明,以固定步长对(可能非凸的)二次函数应用梯度下降(GD)最小化,等价于在梯度上运行幂法(PM)。从而建立了固定步长 GD 与 PM(含与不含固定动量)之间的联系。因此,通过 GD 可获得有价值的特征值信息。近期例子显示,应用于局部二次非凸函数的固定步长 GD 可能需指数时间逃离鞍点(Simon S. Du, Chi Jin, Jason D. Lee, Michael I. Jordan, Aarti Singh, and Barnabas Poczos: “Gradient descent can take exponential time to escape saddle points”;S. Paternain, A. Mokhtari, and A. Ribeiro: “A newton-based method for nonconvex optimization with fast evasion of saddle points”)。本文重访这些例子,并指出其中缺失了特征值信息,故这些例子或许未能完整刻画 GD 的潜在实际行为。因此,有必要持续研究 GD 在非凸函数上的行为,可能采用\emph{自适应}或\emph{变}步长。我们证明,在 中二次函数的特例下,若已知一特征值,则固定步长 GD 将在两次迭代内收敛,并可获得完整特征分解。通过考察梯度与迭代点的动力学,我们提出新的步长策略以提升 GD 的实际表现。文中给出若干数值例子,展示了利用 GD–PM 联系的优势。
引用
@article{arxiv.2211.00866,
title = {Gradient Descent and the Power Method: Exploiting their connection to find the leftmost eigen-pair and escape saddle points},
author = {Rachael Tappenden and Martin Takáč},
journal= {arXiv preprint arXiv:2211.00866},
year = {2022}
}