中文

过参数化非凸 Burer–Monteiro 分解的预条件梯度下降与全局最优性认证

最优化与控制 2025-04-22 v3 机器学习 机器学习

摘要

我们考虑使用梯度下降在 n×rn\times r 因子矩阵 XX 上最小化非凸函数 f(X)=ϕ(XXT)f(X)=\phi(XX^{T}),其中 ϕ\phi 是定义在 n×nn\times n 矩阵上的底层光滑凸代价函数。虽然只能在合理时间内可证明地找到二阶平稳点 XX,但若 XX 额外是秩亏的,则其秩亏性可证明其为全局最优。这种全局最优性认证方式必然要求当前迭代 XX 的搜索秩 rr 相对于全局极小元 XX^{\star} 的秩 rr^{\star} 是过参数化的。遗憾的是,过参数化显著减慢了梯度下降的收敛速度,从 r=rr=r^{\star} 时的线性速率降至 r>rr>r^{\star} 时的次线性速率,即便 ϕ\phi 是强凸的。本文中,我们提出一种廉价的预条件子,在过参数化情形下将梯度下降的收敛速率恢复为线性,同时使其对全局极小元 XX^{\star} 中可能的病态性不敏感。

关键词

引用

@article{arxiv.2206.03345,
  title  = {Preconditioned Gradient Descent for Overparameterized Nonconvex Burer--Monteiro Factorization with Global Optimality Certification},
  author = {Gavin Zhang and Salar Fattahi and Richard Y. Zhang},
  journal= {arXiv preprint arXiv:2206.03345},
  year   = {2025}
}

备注

v2: accepted at JMLR. v3: minor correction in proof of Lemma 27