中文

通过新型下界构造证明集中式分布式优化的有限可扩展性

最优化与控制 2026-03-31 v2 分布式、并行与集群计算 机器学习

摘要

我们考虑经典联邦学习设置下的集中式分布式优化,其中 n 个工作者共同寻找非凸函数 f 的 ε-稳定点,f 为 L-光滑、d 维函数,且仅访问无偏随机梯度,方差为 σ²。每个工作者计算随机梯度最多需要 h 秒,服务器到工作者和工作者到服务器的通信时间分别为 τ_s 和 τ_w 秒/坐标。分布式优化的一个主要动机是相对于 n 实现可扩展性。例如,众所周知,分布式SGD的方差相关运行时间项为 (h σ² L Δ)/(n ε²),随着工作者数量 n 的增加而改善,其中 Δ = f(x⁰) - f*,x⁰ 为初始点。类似地,通过使用无偏稀疏压缩器,还可以在降低方差相关运行时间项和通信运行时间项方面取得效果。然而,一旦考虑到服务器到工作者的通信 τ_s,我们证明即使在均匀(i.i.d.)情况下,使用无偏随机稀疏压缩器也无法设计出一种在 n 上以多对数时间尺度改善服务器端通信运行时间项 τ_s d (L Δ)/ε 和方差相关运行时间项 (h σ² L Δ)/ε²的方法。为建立此结果,我们构造了一个新的“最差情况”函数,并发展了新的下界框架,将分析归约到随机和的聚集,从而为此证明了一个聚集不等式。这些结果揭示了即使在均匀假设下,分布式优化可扩展性的根本限制。

关键词

引用

@article{arxiv.2506.23836,
  title  = {Proving the Limited Scalability of Centralized Distributed Optimization via a New Lower Bound Construction},
  author = {Alexander Tyurin},
  journal= {arXiv preprint arXiv:2506.23836},
  year   = {2026}
}