从 PowerSGD 到 PowerSGD+:具有收敛保证的分布式优化低秩梯度压缩
最优化与控制
2025-09-16 v1 机器学习
摘要
低秩梯度压缩方法(如 PowerSGD)在通信高效的分布式优化中受到广泛关注。然而,PowerSGD 的收敛保证仍不明确,尤其是在随机设置中。在本文中,我们证明 PowerSGD 并不总是收敛到最优解,并提供一个清晰的反例来支持这一发现。为解决这一问题,我们引入了 PowerSGD+,它通过奇异值分解定期更新投影子空间,确保其始终与最优子空间对齐。我们证明了 PowerSGD+ 在标准假设下收敛,并通过在大型语言模型任务上的经验评估验证了其有效性。
引用
@article{arxiv.2509.11254,
title = {From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees},
author = {Shengping Xie and Chuyan Chen and Kun Yuan},
journal= {arXiv preprint arXiv:2509.11254},
year = {2025}
}