无动量的块加速:最小二乘问题块梯度下降的最优步长
最优化与控制
2024-05-28 v1 数值分析
数值分析
摘要
块坐标下降是一种适用于大数据优化的强大算法模板。该模板包含许多变体,包括块梯度下降 (BGD),它对选定的变量块执行梯度下降,同时保持其他变量固定。长期以来,每个块的步长默认设置为 1 除以该块的 Lipschitz 光滑常数,模仿了梯度下降 (GD) 的原始步长规则。然而,BGD 的这种选择尚未能理论上证明其相对于 GD 的经验优越性,因为现有 BGD 的收敛速率在确定性情况下具有比 GD 更差的常数。为了寻找这种理论依据,我们建立了一个简单环境,考虑将 BGD 应用于具有两个变量块的最小二乘问题。假设每个块对应的数据矩阵是正交的,我们找到了 BGD 的闭式最优步长,这些步长可证明地导致渐近收敛速率是带 Polyak 动量的 GD 的两倍;这意味着,在该正交性假设下,只需调整步长而无需添加任何动量,就可以加速 BGD。满足此假设的一个应用是子空间之间的广义交替投影,将我们的步长应用于该问题,改进了先前曾被(略微不准确地)声称是最优的收敛速率。主要证明思路是在步长变量中最小化控制收敛速率的矩阵的谱半径。
引用
@article{arxiv.2405.16020,
title = {Block Acceleration Without Momentum: On Optimal Stepsizes of Block Gradient Descent for Least-Squares},
author = {Liangzu Peng and Wotao Yin},
journal= {arXiv preprint arXiv:2405.16020},
year = {2024}
}
备注
36 pages, accepted to ICML 2024