中文

MoEntwine:释放硅片规模芯片在大规模专家并行推理潜力

分布式、并行与集群计算 2025-10-30 v1

摘要

随着大语言模型(LLM)规模不断扩大,混合专家(MoE)已成为 SOTA 模型中的常见技术。MoE 模型依赖专家并行(EP)来缓解内存瓶颈,这会引入跨设备的全交换通信,以分配和组合标记。然而,在广泛采用的 GPU 集群中,跨节点的高开销全交换通信使全交换成本高昂,阻碍了 EP 的采用。最近,硅片规模芯片(WSC)作为将大量设备集成在硅片级互联器上的平台,提供统一的高性能网络连接所有设备,为托管 MoE 模型提供了前景的潜力。然而,其网络仅受限于网格拓扑,导致通信压力不均衡并引发性能损失。此外,缺乏硅片内磁盘导致关键路径上的高开销专家迁移。为充分释放潜力,我们首先提出Entwined Ring Mapping(ER-Mapping),其在注意力层和 MoE 层之间协设计映射,以平衡通信压力并实现更佳性能。我们发现,ER-Mapping 下,冷链和热链在注意力层和 MoE 层之间的分布是互补的。因此,为隐藏迁移开销,我们提出Non-invasive Balancer(NI-Balancer),将完整的专家迁移分割为多个步骤,交替利用两者的冷链。评估表明,ER-Mapping 实现了最高 62% 的通信降低;NI-Balancer 进一步在 MoE 计算和通信方面分别实现 54% 和 22% 的改进。相较于 SOTA NVL72 超级节点,WSC 平台因其对更大规模 EP 的可扩展性,实现了平均 39% 的设备级 MoE 性能提升。

关键词

引用

@article{arxiv.2510.25258,
  title  = {MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference},
  author = {Xinru Tang and Jingxiang Hou and Dingcheng Jiang and Taiquan Wei and Jiaxin Liu and Jinyi Deng and Huizheng Wang and Qize Yang and Haoran Shang and Chao Li and Yang Hu and Shouyi Yin},
  journal= {arXiv preprint arXiv:2510.25258},
  year   = {2025}
}