中文

通过张量分块统一深度学习中的数据、模型与混合并行

分布式、并行与集群计算 2018-05-14 v1 机器学习

摘要

深度学习系统已成为众多领域的重要工具,但不断增长的模型规模意味着必须加速训练以维持此类系统的效用。当前如 Tensorflow 和 MXNet 的系统聚焦于一种特定的并行策略——数据并行,其需要扩展的大训练批量才能规模化。我们将寻找最佳并行策略的问题转化为寻找最佳分块以划分张量并使总体通信最少的问题。我们提出一种能找到最优分块的算法。我们所得的并行化方案是数据并行与模型并行的混合。我们构建了执行自动并行的 SoyBean 系统。SoyBean 基于其所找到的最优分块,自动将现有深度学习系统前端捕获的串行数据流图转换为并行数据流图。我们的评估显示,对于 AlexNet 和 VGG,SoyBean 比纯数据并行快 1.5 至 4 倍。我们在新系统 SoyBean 中提出了此自动分块,其可作为 Tensorflow、MXNet 等的后端。

关键词

引用

@article{arxiv.1805.04170,
  title  = {Unifying Data, Model and Hybrid Parallelism in Deep Learning via Tensor Tiling},
  author = {Minjie Wang and Chien-chin Huang and Jinyang Li},
  journal= {arXiv preprint arXiv:1805.04170},
  year   = {2018}
}