中文

面向异构系统的偏置 Local SGD

机器学习 2026-02-24 v3

摘要

大多数并行神经网络训练方法假设计算资源是均匀的。例如,在异构工作负载下,同步数据并行 SGD 会产生显著的同步开销,常迫使实践者仅依赖最快的设备(如 GPU)。本文研究了在异构系统上进行高效并行训练的局部 SGD。我们表明,有意引入数据采样和模型聚合中的偏置可有效调和速度较慢的 CPU 与更快的 GPU。我们的广泛实证结果表明, Carefully 控制的偏置显著加速局部 SGD,在相同的 epoch 预算下实现与同步 SGD 相当甚至更高的准确率。例如,我们的方法在 2 个 CPU 和 8 个 GPU 上训练 CIFAR-10 上的 ResNet20,速度可快达同步 SGD 的 32 倍,准确率几乎相同。这些结果为在深度学习中灵活利用多样计算资源提供了实用见解。

关键词

引用

@article{arxiv.2508.08540,
  title  = {Biased Local SGD for Efficient Deep Learning on Heterogeneous Systems},
  author = {Jihyun Lim and Junhyuk Jo and Chanhyeok Ko and Young Min Go and Jimin Hwa and Sunwoo Lee},
  journal= {arXiv preprint arXiv:2508.08540},
  year   = {2026}
}