中文

网格网络上高可用数据并行机器学习训练

机器学习 2020-11-10 v1 分布式、并行与集群计算

摘要

数据并行 ML 模型在多个加速器上训练可能耗时数天或数周。如此长的训练时长要求资源集群在整个期间保持可用以使作业持续运行。在网格网络上这颇具挑战,因为故障会在网格中造成空洞。数据包须绕开失效芯片路由以维持全连通。本文提出在二维网格上绕开失效芯片路由梯度求和 allreduce 流量的技术。我们通过 MLPerf-v0.7 ResNet-50 与 BERT 基准评估了容错 allreduce 技术的性能。性能结果显示,在 512 与 1024 块 TPU-v3 芯片上训练吞吐量的影响极小。

关键词

引用

@article{arxiv.2011.03605,
  title  = {Highly Available Data Parallel ML training on Mesh Networks},
  author = {Sameer Kumar and Norm Jouppi},
  journal= {arXiv preprint arXiv:2011.03605},
  year   = {2020}
}