Nebula-I:低带宽云集群上协同训练深度学习模型的通用框架
机器学习
2022-05-20 v1 人工智能
分布式、并行与集群计算
摘要
不断增长的模型规模与计算尺度引发了在多节点上训练深度学习模型的日益浓厚的兴趣。然而,当涉及在云集群上、尤其是跨远程集群训练时,面临巨大挑战。本工作中,我们引入一个通用框架 Nebula-I,用于在远程异构集群上协同训练深度学习模型,这些集群之间的连接为低带宽广域网(WAN)。我们以自然语言处理(NLP)为例展示 Nebula-I 在不同训练阶段的工作方式,包括:a) 使用两个远程集群预训练多语言语言模型;b) 利用从预训练模型蒸馏所得知识微调机器翻译模型,这贯穿了近期深度学习最流行的范式。为平衡精度与通信效率,Nebula-I 中联合应用了参数高效训练策略、混合并行计算方法与自适应通信加速技术。同时,采用安全策略以保障集群内计算与集群间通信的安全、可靠与隐私。Nebula-I 基于 PaddlePaddle 深度学习框架实现,可支持异构硬件(如 GPU 与 NPU)上的协同训练。实验表明,所提框架能在保持令人满意的 NLP 性能的同时大幅提升训练效率。通过使用 Nebula-I,用户可以以最小开发量在云集群上运行大规模训练任务,且已有大型预训练模型的效用可进一步发挥。我们还基于一种新颖的学习框架与 Nebula-I 给出了跨语言自然语言推理任务上的新 SOTA 结果。
引用
@article{arxiv.2205.09470,
title = {Nebula-I: A General Framework for Collaboratively Training Deep Learning Models on Low-Bandwidth Cloud Clusters},
author = {Yang Xiang and Zhihua Wu and Weibao Gong and Siyu Ding and Xianjie Mo and Yuang Liu and Shuohuan Wang and Peng Liu and Yongshuai Hou and Long Li and Bin Wang and Shaohuai Shi and Yaqian Han and Yue Yu and Ge Li and Yu Sun and Yanjun Ma and Dianhai Yu},
journal= {arXiv preprint arXiv:2205.09470},
year = {2022}
}
备注
20 pages, 10 figures, technical report