A3D-MoE:通过三维异构集成加速混合专家大语言模型
硬件体系结构
2025-07-28 v1
摘要
传统大语言模型(LLM)通常配备数十 GB 至 TB 级的模型参数,导致推理过程能耗高且成本昂贵,因为计算过程中所有权重均需加载到片上处理单元。近年来,混合专家(MoE)架构作为一种高效替代方案崭露头角,有望以更少的每 token 激活权重实现高效推理。然而,细粒度 MoE 大语言模型仍面临若干挑战:1) 运行时可变的工作负载产生任意的 GEMV-GEMM 比例,降低硬件利用率;2) 传统面向 LLM 服务的 MoE 调度无法将注意力操作与 MoE 操作融合,导致延迟增加与硬件利用率下降;3) 尽管相较于传统 LLM 更为高效,但从 DRAM 加载专家仍消耗大量能量并需要可观的 DRAM 带宽。为应对上述挑战,我们提出:1) A3D-MoE,一种采用前沿垂直集成技术的三维异构集成系统,可显著提升内存带宽,同时降低片上网络(NoC)开销与能耗;2) 一种具有 V-Cache 高效数据复用与新颖统一三维数据流的三维自适应 GEMV-GEMM 比例脉动阵列,以解决不同工作负载下任意 GEMV-GEMM 比例所导致的硬件利用率下降问题;3) 一种硬件资源感知的操作融合调度器,将注意力操作与 MoE 操作融合以提升硬件性能;4) MoE 分数感知的 HBM 访问缩减机制,结合奇偶专家放置策略,降低 DRAM 访问与带宽需求。评估结果表明,A3D-MoE 带来了显著的性能提升,相较于当前最优方法,延迟降低 1.8x 至 2x,能耗降低 2x 至 4x,吞吐量提升 1.44x 至 1.8x。
引用
@article{arxiv.2507.19142,
title = {A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration},
author = {Wei-Hsing Huang and Janak Sharda and Cheng-Jhih Shih and Yuyao Kong and Faaiq Waqar and Pin-Jun Chen and Yingyan and Lin and Shimeng Yu},
journal= {arXiv preprint arXiv:2507.19142},
year = {2025}
}