利用动态重编译优化混合专家模型
机器学习
2022-08-03 v2 分布式、并行与集群计算
摘要
混合专家(Mixture of Experts)架构通过使模型参数规模独立于计算需求(FLOPs)进行扩展,从而支持极其庞大的神经网络。然而,当前 DNN 框架无法有效支持混合专家中的动态数据流,基于这些框架的实现需要使用引入显著开销的变通方法。为解决这些框架的局限,我们提出 DynaMoE,一个利用动态重编译优化并调整计算资源使用以适应混合专家模型动态需求的 DNN 库。我们的评估显示,即便不使用重编译,DynaMoE 相比现有 MoE 系统实现了 1.8 倍加速并支持大 2.3 倍的模型规模。我们随后展示由动态重编译实现的进一步优化,在降低内存压力并提升模型质量的同时带来额外 1.7 倍加速。
引用
@article{arxiv.2205.01848,
title = {Optimizing Mixture of Experts using Dynamic Recompilations},
author = {Ferdinand Kossmann and Zhihao Jia and Alex Aiken},
journal= {arXiv preprint arXiv:2205.01848},
year = {2022}
}
备注
13 pages, 15 figures