中文

MoESys:面向互联网服务的分布式高效混合专家训练与推理系统

分布式、并行与集群计算 2024-08-13 v3 人工智能

摘要

尽管现代互联网服务(如聊天机器人、搜索引擎和在线广告)需要使用大规模深度神经网络(DNNs),但期望在异构计算系统上进行分布式训练与推理以支撑这些DNN模型。混合专家(MoE)是通过门控与分治式并行在保持模型/数据总体规模下降低训练成本的最常用策略之一。尽管DeepSpeed已致力于在异构基础设施上开展大规模MoE训练,但从负载均衡、通信/计算效率及内存占用限制等系统层面仍可进一步提升训练与推理效率。本工作中,我们提出一种新颖的MoESys,在大规模训练与推理中均提升效率。具体而言,在训练过程中,所提MoESys采用弹性MoE训练策略,结合分层存储上的二维预取与融合通信,以享受高效并行。针对单节点可扩展推理(尤其当模型尺寸大于GPU内存时),MoESys将CPU-GPU内存联合构建为分段环以加载模型,并以轮询方式跨内存段执行计算任务以实现高效推理。我们开展了大量实验评估MoESys,其中MoESys在48张A100 GPU卡上于8天内成功训练了具有120亿参数稀疏门控混合专家模型的统一特征优化(UFO)模型。与最先进方法的对比显示,MoESys在训练中吞吐量(每秒令牌数)高出DeepSpeed 33%,推理中普遍高出13%。特别是在非均衡MoE任务(如UFO)下,MoESys实现了64%更高的吞吐量且内存占用降低18%。

关键词

引用

@article{arxiv.2205.10034,
  title  = {MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services},
  author = {Dianhai Yu and Liang Shen and Hongxiang Hao and Weibao Gong and Huachao Wu and Jiang Bian and Lirong Dai and Haoyi Xiong},
  journal= {arXiv preprint arXiv:2205.10034},
  year   = {2024}
}