Apache Spark 中用于深度网络训练的数据与模型并行、分布式可扩展框架
机器学习
2017-08-22 v1 人工智能
计算机视觉与模式识别
分布式、并行与集群计算
机器学习
摘要
训练深度网络昂贵且耗时,训练周期随数据规模和模型参数的增长而增加。在本文中,我们提供了一个在 Apache Spark 中跨 CPU 集群进行深度网络分布式训练的框架。该框架同时实现了数据并行和模型并行,使其适用于需要海量训练数据以及模型参数过大而无法装入单台机器内存的深度网络。它可以轻松地在廉价商用硬件集群上扩展,以获得显著的加速比和更好的结果,与 GPU 集群和超级计算机相比相当经济。我们针对网络被划分到多台机器的情况(模型并行)提出了一种新的深度网络训练算法,并给出了详细的代价分析和收敛性证明。我们已为全连接前馈网络、卷积神经网络、循环神经网络和长短期记忆架构开发了实现。我们展示了大量仿真结果,证明了我们的框架在不同数据和模型参数规模下,随着工作核心/分区数量的变化所获得的加速比和精度;从而表明我们提出的框架可以实现显著的加速比(CNN 最高达 11 倍)并且具有很好的可扩展性。
引用
@article{arxiv.1708.05840,
title = {A Data and Model-Parallel, Distributed and Scalable Framework for Training of Deep Networks in Apache Spark},
author = {Disha Shrivastava and Santanu Chaudhury and Dr. Jayadeva},
journal= {arXiv preprint arXiv:1708.05840},
year = {2017}
}
备注
12 pages