SLIDE:在大规模深度学习系统中为智能算法辩护以抗衡硬件加速
分布式、并行与集群计算
2020-03-03 v2 机器学习
摘要
深度学习(DL)算法是现代机器学习系统的核心焦点。随着数据量持续增长,习惯上训练具有数亿参数的大型神经网络,以维持足够容量记忆这些体量并获得最先进精度。为规避大模型与数据带来的昂贵计算,学界正日益投资于专用硬件用于模型训练。然而,专用硬件昂贵且难以推广至众多任务。算法前沿的进展未能展示出相对于如 NVIDIA-V100 GPU 等强大硬件的直接优势。本文提供了一个例外。我们提出 SLIDE(Sub-LInear Deep learning Engine),其独特地融合智能随机算法与多核并行及工作负载优化。仅使用 CPU,SLIDE 大幅减少训练与推理中的计算,优于最佳可用 GPU 上 Tensorflow(TF)的优化实现。我们在工业级推荐数据集及大型全连接架构上的评估表明,在 44 核 CPU 上用 SLIDE 训练比在 Tesla V100 上用 TF 训练同一网络在任何给定精度水平下快逾 3.5 倍(1 小时 vs. 3.5 小时)。在同一 CPU 硬件上,SLIDE 比 TF 快逾 10 倍。我们提供代码与脚本以保证可复现性。
引用
@article{arxiv.1903.03129,
title = {SLIDE : In Defense of Smart Algorithms over Hardware Acceleration for Large-Scale Deep Learning Systems},
author = {Beidi Chen and Tharun Medini and James Farwell and Sameh Gobriel and Charlie Tai and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:1903.03129},
year = {2020}
}
备注
Published at MLSys 2020