中文

感知掉队者的分布式学习:通信与计算延迟的权衡

信息论 2020-06-24 v1 分布式、并行与集群计算 机器学习 信号处理 math.IT

摘要

当梯度下降(GD)扩展到许多并行工作节点以处理大规模机器学习问题时,其每轮迭代的计算时间受限于掉队的工作节点。通过跨数据和计算分配冗余计算与编码,可以容忍掉队节点,但在大多数现有方案中,每个非掉队节点在完成所有计算后,每轮迭代向参数服务器(PS)传输一条消息。施加这样的限制会导致两个主要缺陷:由于对掉队行为预测不准确而产生的过度计算,以及由于将工作节点视为掉队/非掉队并丢弃掉队节点执行的局部计算而造成的利用率不足。在本文中,为克服这些缺陷,我们考虑多消息通信(MMC),允许每个工作节点每轮迭代传递多个计算结果,并相应地设计避免掉队的技术。然后,我们分析了所提出的设计如何被高效用于寻求计算与通信延迟之间的平衡,以最小化总体延迟。此外,通过大量仿真(包括基于模型的和在 Amazon EC2 服务器上的真实实现),我们明确了这些设计在不同设置下的优缺点,并证明 MMC 有助于改进现有的避免掉队方案。

关键词

引用

@article{arxiv.2004.04948,
  title  = {Straggler-aware Distributed Learning: Communication Computation Latency Trade-off},
  author = {Emre Ozfatura and Sennur Ulukus and Deniz Gunduz},
  journal= {arXiv preprint arXiv:2004.04948},
  year   = {2020}
}

备注

This paper was presented in part at the 2019 IEEE International Symposium on Information Theory (ISIT) in Paris, France, and at the 2019 IEEE Data Science Workshop in Minneapolis, USA