中文

Harmony:克服 GPU 内存容量障碍在商用服务器上训练大规模 DNN 模型

分布式、并行与集群计算 2022-08-02 v2 机器学习

摘要

在过去十年中,深度神经网络(DNN)的规模呈指数级增长,使得只有拥有大规模数据中心资源的机构能够开发和训练此类模型。对于可能仅有有限资源(例如单台多 GPU 服务器)的广大尾部研究者而言,主要挑战之一是相较于模型规模而言有限的 GPU 内存容量。该问题如此严峻,以至于训练大规模 DNN 模型的内存需求常常超出单台服务器上所有可用 GPU 的聚合容量;随着模型规模不断增长的趋势,这一问题只会更加恶化。当前依赖虚拟化 GPU 内存(通过与 CPU 内存交换)的方案带来了过高的交换开销。在本文中,我们提出一种新的训练框架 Harmony,并主张重新思考 DNN 框架如何调度计算与移动数据,以在单台商用服务器上高效训练大规模模型的边界。在各类大规模 DNN 模型上,Harmony 能够将交换负载减少多达两个数量级,并相较具有虚拟化内存的高度优化基线获得高达 7.6 倍的训练吞吐加速。

关键词

引用

@article{arxiv.2202.01306,
  title  = {Harmony: Overcoming the Hurdles of GPU Memory Capacity to Train Massive DNN Models on Commodity Servers},
  author = {Youjie Li and Amar Phanishayee and Derek Murray and Jakub Tarnawski and Nam Sung Kim},
  journal= {arXiv preprint arXiv:2202.01306},
  year   = {2022}
}

备注

Accepted at VLDB 2022