中文

通过高效图遍历顺序加速模型并行训练中的设备放置

机器学习 2024-10-28 v1 人工智能

摘要

现代神经网络需要长时间训练才能在庞大数据集上达到可观的性能。加速训练的一种常见方法是模型并行化,即将大型神经网络拆分到多个设备上。然而,同一神经网络的不同设备放置方案会导致不同的训练时间。现有的大多数设备放置解决方案将问题视为顺序决策,通过遍历神经网络计算图并将其神经元分配到不同设备。本工作研究了图遍历顺序对设备放置的影响。具体而言,我们通过实验研究了不同的图遍历顺序如何导致不同的设备放置,进而影响训练执行时间。实验结果表明,最佳的图遍历顺序取决于神经网络的类型及其计算图的特征。在本工作中,我们还为各种神经网络族在选择设备放置的图遍历顺序方面提供了建议,以改善模型并行化的训练时间。

关键词

引用

@article{arxiv.2201.09676,
  title  = {Accelerate Model Parallel Training by Using Efficient Graph Traversal Order in Device Placement},
  author = {Tianze Wang and Amir H. Payberah and Desta Haileselassie Hagos and Vladimir Vlassov},
  journal= {arXiv preprint arXiv:2201.09676},
  year   = {2024}
}

备注

This work has been submitted for possible publication