中文

HyperTune:面向异构系统上 DNN 训练高效分布的动态超参数调优

分布式、并行与集群计算 2020-07-17 v1 机器学习

摘要

分布式训练是加速深度神经网络(DNN)训练的一种新方法,但常见的训练库难以应对具有异构处理器的分布式情形,或处理节点被其他工作负载中断的情形。本文描述了在算力存储设备(CSD)上的 DNN 分布式训练,CSD 是基于 NAND 闪存的大容量数据存储,带有内部处理引擎。基于 CSD 的分布式架构通过消除存储设备与主机处理器间不必要的数据移动,融合了联邦学习在性能可扩展性、弹性和数据隐私方面的优势。本文还描述了 Stannis,一种 DNN 训练框架,它通过动态调优异构系统中的训练超参数,以维持每秒处理图像数和能效方面的最大整体处理速度,从而改进现有分布式训练框架的不足。在图像分类训练基准上的实验结果表明,相较于通用系统,使用 Stannis 加 CSD 可实现高达 3.1 倍的性能提升与 2.45 倍的能耗降低。

关键词

引用

@article{arxiv.2007.08077,
  title  = {HyperTune: Dynamic Hyperparameter Tuning For Efficient Distribution of DNN Training Over Heterogeneous Systems},
  author = {Ali HeydariGorji and Siavash Rezaei and Mahdi Torabzadehkashi and Hossein Bobarshad and Vladimir Alves and Pai H. Chou},
  journal= {arXiv preprint arXiv:2007.08077},
  year   = {2020}
}