中文

流式 Krylov 加速随机梯度下降

数值分析 2025-05-13 v1 机器学习 数值分析

摘要

我们提出 SKA-SGD (Streaming Krylov-Accelerated Stochastic Gradient Descent),这是一种新型优化方法,通过将随机梯度投影到低维 Krylov 子空间来加速病条件问题的收敛。该方法直接受近期在 s 步共轭梯度方法中结合流式 Gauss-Seidel Gram 求解器 \cite{dambra2025sstep} 取得的进展所启发,将这些技术扩展到随机优化领域。我们的方法结合了三个关键创新:(1) 通过单次流式 Gauss-Seidel 迭代计算投影系数,数学上等价于修正 Gram-Schmidt 正交化;(2) 采用切比雪夫多项式基为构建 Krylov 子空间提供更好的数值稳定性;(3) 使用 AMD GPU 的 HIP 实现。我们证明,流式方法实现的向后误差接近机器精度,复杂度为 O(s2)O(s^2) 而非 O(s3)O(s^3),其中 ss 为 Krylov 子空间维数。实验结果表明,SKA-SGD 在收敛速度和最终误差方面显著优于标准 SGD 和 Adam,特别是对于条件数超过 10310^3 的问题。GPU 性能分析揭示,通信规避的优势在计算开销超过时出现交叉点,通常在问题规模 n106n \geq 10^6 时约为 64 个处理器的中等规模出现。

关键词

引用

@article{arxiv.2505.07046,
  title  = {Streaming Krylov-Accelerated Stochastic Gradient Descent},
  author = {Stephen Thomas},
  journal= {arXiv preprint arXiv:2505.07046},
  year   = {2025}
}