中文

结合模型部署与通信调度优化混合专家模型推理时间

机器学习 2024-10-23 v1 网络与互联网体系结构

摘要

随着机器学习模型规模和复杂性的增长,其计算需求成为重大障碍。混合专家(MoE)模型通过选择性激活相关专家来缓解这一问题。尽管如此,MoE 模型仍受到全对全操作带来的高通信开销、同步通信约束导致的低 GPU 利用率以及异构 GPU 环境带来的复杂性的困扰。本文提出了 Aurora,它通过优化模型部署和全对全通信调度来应对 MoE 推理中的这些挑战。Aurora 通过在全对全通信中策略性地排序令牌传输,实现了最小的通信时间。它通过将来自不同模型的专家共置于同一设备上,避免了同步全对全通信的限制,从而提高了 GPU 利用率。我们在四种常见的 GPU 集群设置(GPU 上的独占模型与共置模型,以及同构 GPU 与异构 GPU)下从理论上分析了 Aurora 的优化策略。Aurora 为三种情况提供了最优解,而对于剩余的 NP-hard 场景,它提供了一个多项式时间的次优解,其性能仅比最优解下降 1.07 倍。Aurora 是首个通过跨多种场景的最优模型部署和通信调度来最小化 MoE 推理时间的方法。评估表明,Aurora 显著加速了推理,在同构集群中实现了高达 2.38 倍的加速,在异构环境中实现了高达 3.54 倍的加速。此外,与现有方法相比,Aurora 将 GPU 利用率提高了高达 1.5 倍。

关键词

引用

@article{arxiv.2410.17043,
  title  = {Optimizing Mixture-of-Experts Inference Time Combining Model Deployment and Communication Scheduling},
  author = {Jialong Li and Shreyansh Tripathi and Lakshay Rastogi and Yiming Lei and Rui Pan and Yiting Xia},
  journal= {arXiv preprint arXiv:2410.17043},
  year   = {2024}
}