中文

以少博多:结构化部分反向传播如何提升深度学习集群性能

分布式、并行与集群计算 2021-11-23 v1 机器学习

摘要

许多机构采用配备 GPU 和 TPU 等加速器的计算集群以分布式方式训练深度学习模型。训练是资源密集型的,消耗大量计算、内存和网络资源。许多先前工作探索如何在不影响模型质量的前提下降低训练资源占用,但它们聚焦于部分瓶颈(通常仅网络)限制了其提升整体集群利用率的能力。在本工作中,我们利用深度学习负载的独特特性提出结构化部分反向传播(SPB, Structured Partial Backpropagation),一种在分布式训练中系统控制各工作节点反向传播量的技术。这在保持模型质量的同时,同时降低网络带宽、计算利用率和内存占用。为在集群层面高效利用 SPB 的优势,我们引入 JigSaw,一种支持 SPB 的调度器,它对深度学习训练(DLT)作业在迭代级别进行调度。我们发现 JigSaw 可将大规模集群效率提升高达 28%。

关键词

引用

@article{arxiv.2111.10672,
  title  = {Doing More by Doing Less: How Structured Partial Backpropagation Improves Deep Learning Clusters},
  author = {Adarsh Kumar and Kausik Subramanian and Shivaram Venkataraman and Aditya Akella},
  journal= {arXiv preprint arXiv:2111.10672},
  year   = {2021}
}

备注

Accepted at DistributedML-2021