中文

在梯度编码中利用部分迟缓 worker

信息论 2024-11-19 v2 math.IT

摘要

在分布式学习中,worker 通常在分配的数据块上计算梯度并将其发送给参数服务器(PS),后者聚合它们以计算对 loss function LL 的梯度 L\nabla L 的 exact 或 approximate 版本。然而,在大型集群中,许多 worker 比承诺的速度慢或甚至容易出错。梯度编码解决方案在数据块分配给 worker 方面引入冗余,并利用编码理论思想,使 PS 能够在存在迟缓 worker 时恢复 L\nabla L(exact 或 approximate)。不幸的是,大多数现有梯度编码协议在计算效率方面不够高效,因为它们粗略地将 worker 分类为 operational 或 failed;partial straggler 执行的潜在有价值工作被忽略了。本文中,我们提出了 novel 梯度编码协议,慷慨地利用 partial straggler 执行的工作。我们的协议在计算和通信方面都高效,并具有数值稳定性。对于重要的 chunk 分配类,我们提出了高效的算法来优化 chunk 在 worker 中的相对排序;这种排序影响整体执行时间。对于 exact 梯度重建,我们的协议比原始协议快约 2×2\times,而对于 approximate �梯度重建,其重构梯度的均方误差要好几个数量级。

关键词

引用

@article{arxiv.2405.19509,
  title  = {Leveraging partial stragglers within gradient coding},
  author = {Aditya Ramamoorthy and Ruoyu Meng and Vrinda S. Girimaji},
  journal= {arXiv preprint arXiv:2405.19509},
  year   = {2024}
}

备注

12 pages, 7 figures