Harmony:克服 GPU 内存容量障碍在商用服务器上训练大规模 DNN 模型
分布式、并行与集群计算
2022-08-02 v2 机器学习
摘要
在过去十年中,深度神经网络(DNN)的规模呈指数级增长,使得只有拥有大规模数据中心资源的机构能够开发和训练此类模型。对于可能仅有有限资源(例如单台多 GPU 服务器)的广大尾部研究者而言,主要挑战之一是相较于模型规模而言有限的 GPU 内存容量。该问题如此严峻,以至于训练大规模 DNN 模型的内存需求常常超出单台服务器上所有可用 GPU 的聚合容量;随着模型规模不断增长的趋势,这一问题只会更加恶化。当前依赖虚拟化 GPU 内存(通过与 CPU 内存交换)的方案带来了过高的交换开销。在本文中,我们提出一种新的训练框架 Harmony,并主张重新思考 DNN 框架如何调度计算与移动数据,以在单台商用服务器上高效训练大规模模型的边界。在各类大规模 DNN 模型上,Harmony 能够将交换负载减少多达两个数量级,并相较具有虚拟化内存的高度优化基线获得高达 7.6 倍的训练吞吐加速。
引用
@article{arxiv.2202.01306,
title = {Harmony: Overcoming the Hurdles of GPU Memory Capacity to Train Massive DNN Models on Commodity Servers},
author = {Youjie Li and Amar Phanishayee and Derek Murray and Jakub Tarnawski and Nam Sung Kim},
journal= {arXiv preprint arXiv:2202.01306},
year = {2022}
}
备注
Accepted at VLDB 2022