中文

通过算子与张量联合融合优化分布式训练中的 DNN 编译

分布式、并行与集群计算 2022-09-27 v1

摘要

本文提出 DisCo,一个用于数据并行分布式训练的自动深度学习编译模块。与大多数专注于单设备训练或推理的深度学习编译器不同,DisCo 针对跨多台 GPU 机器的分布式训练优化 DNN 模型。现有的单设备编译策略在分布式训练中表现不佳,主要由于其引发的通信低效。DisCo 生成优化的、联合的计算算子与通信张量融合策略,以实现高效的分布式训练。我们构建了一个基于 GNN 的模拟器,以有效估计算子/张量融合候选方案所达到的每轮迭代训练时间。一个由该模拟器驱动的回溯搜索算法,在庞大的策略空间中高效导航,以找出最小化分布式训练时间的优良算子/张量融合策略。我们将 DisCo 与现有 DL 融合方案比较,表明其取得了接近理想的、完全计算-通信重叠情况的良好训练加速。

关键词

引用

@article{arxiv.2209.12769,
  title  = {Optimizing DNN Compilation for Distributed Training with Joint OP and Tensor Fusion},
  author = {Xiaodong Yi and Shiwei Zhang and Lansong Diao and Chuan Wu and Zhen Zheng and Shiqing Fan and Siyu Wang and Jun Yang and Wei Lin},
  journal= {arXiv preprint arXiv:2209.12769},
  year   = {2022}
}