中文

HD-MoE:面向3D近存算的混合型Mixture-of-Expert LLM

性能 2025-09-12 v1

摘要

拥有Mixture-of-Expert(MoE)架构的大型语言模型(LLM)通过减少计算成本实现卓越的模型性能,但其代价是高昂的存储容量和带宽要求。直接通过混合键合将存储堆叠在计算上的近存算(NMP)加速器已展现出高带宽和高能效,成为MoE模型的有前景的架构。然而,由于NMP加速器由分布式存储和计算组成,如何将MoE计算直接映射到该架构上决定了LLM推理效率。现有的并行映射策略,包括张量并行(TP)和专家并行(EP),要么导致高通信成本,要么导致计算利用不均,导致效率低下。MoE LLM的动态路由机制进一步恶化了效率挑战。因此,本文提出HD-MoE,用于自动优化NMP加速器上的MoE并行计算。HD-MoE特点包括离线自动混合并行映射算法和在线动态调度策略,以减少通信成本同时最大化计算利用率。通过大量实验结果,我们展示了HD-MoE在TP、EP以及基线混合TP-EP计算平衡并行策略上分别实现了1.1倍至1.8倍、1.1倍至1.5倍、1.0倍至1.4倍的加速。

关键词

引用

@article{arxiv.2509.09420,
  title  = {HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing},
  author = {Haochen Huang and Shuzhang Zhong and Zhe Zhang and Shuangchen Li and Dimin Niu and Hongzhong Zheng and Runsheng Wang and Meng Li},
  journal= {arXiv preprint arXiv:2509.09420},
  year   = {2025}
}

备注

9 pages, 15 figures, International Conference on Computer-Aided Design (ICCAD) 2025