过参数化非凸 Burer–Monteiro 分解的预条件梯度下降与全局最优性认证
最优化与控制
2025-04-22 v3 机器学习
机器学习
摘要
我们考虑使用梯度下降在 因子矩阵 上最小化非凸函数 ,其中 是定义在 矩阵上的底层光滑凸代价函数。虽然只能在合理时间内可证明地找到二阶平稳点 ,但若 额外是秩亏的,则其秩亏性可证明其为全局最优。这种全局最优性认证方式必然要求当前迭代 的搜索秩 相对于全局极小元 的秩 是过参数化的。遗憾的是,过参数化显著减慢了梯度下降的收敛速度,从 时的线性速率降至 时的次线性速率,即便 是强凸的。本文中,我们提出一种廉价的预条件子,在过参数化情形下将梯度下降的收敛速率恢复为线性,同时使其对全局极小元 中可能的病态性不敏感。
引用
@article{arxiv.2206.03345,
title = {Preconditioned Gradient Descent for Overparameterized Nonconvex Burer--Monteiro Factorization with Global Optimality Certification},
author = {Gavin Zhang and Salar Fattahi and Richard Y. Zhang},
journal= {arXiv preprint arXiv:2206.03345},
year = {2025}
}
备注
v2: accepted at JMLR. v3: minor correction in proof of Lemma 27