中文

从 PowerSGD 到 PowerSGD+:具有收敛保证的分布式优化低秩梯度压缩

最优化与控制 2025-09-16 v1 机器学习

摘要

低秩梯度压缩方法(如 PowerSGD)在通信高效的分布式优化中受到广泛关注。然而,PowerSGD 的收敛保证仍不明确,尤其是在随机设置中。在本文中,我们证明 PowerSGD 并不总是收敛到最优解,并提供一个清晰的反例来支持这一发现。为解决这一问题,我们引入了 PowerSGD+,它通过奇异值分解定期更新投影子空间,确保其始终与最优子空间对齐。我们证明了 PowerSGD+ 在标准假设下收敛,并通过在大型语言模型任务上的经验评估验证了其有效性。

关键词

引用

@article{arxiv.2509.11254,
  title  = {From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees},
  author = {Shengping Xie and Chuyan Chen and Kun Yuan},
  journal= {arXiv preprint arXiv:2509.11254},
  year   = {2025}
}