中文

Ensemble-Compression:一种深度神经网络并行训练的新方法

分布式、并行与集群计算 2017-07-19 v2 机器学习 神经与进化计算

摘要

近年来,并行化框架已成为加速深度神经网络(DNN)训练的必要手段。此类框架通常采用模型平均方法,记为MA-DNN,其中并行工作节点基于各自的本地数据进行训练,同时本地模型的参数被定期通信并平均以获得全局模型,该全局模型作为本地模型的新起点。然而,由于DNN是高度非凸的模型,平均参数不能保证该全局模型优于那些本地模型。为解决这个问题,我们引入了一种称为Ensemble-Compression的新并行训练框架,记为EC-DNN。在该框架中,我们提议通过集成来聚合本地模型,即平均本地模型的输出而非参数。由于大多数流行的损失函数对DNN的输出是凸的,基于集成的全局模型的性能保证至少与本地模型的平均性能一样好。然而,一个巨大挑战在于模型大小的爆炸,因为每轮集成可能导致大小倍增。因此,我们在每次集成后执行模型压缩,本文中采用基于蒸馏的方法,以将全局模型的大小缩减至与本地模型相同。我们的实验结果展示了EC-DNN在准确率和加速比方面相对于MA-DNN的显著优势。

关键词

引用

@article{arxiv.1606.00575,
  title  = {Ensemble-Compression: A New Method for Parallel Training of Deep Neural Networks},
  author = {Shizhao Sun and Wei Chen and Jiang Bian and Xiaoguang Liu and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1606.00575},
  year   = {2017}
}

备注

ECML 2017