中文

ReviveMoE:大规模MoE LLM推理部署中硬件故障的快速恢复

分布式、并行与集群计算 2026-02-25 v1

摘要

随着LLM部署规模的扩大,单个硬件故障的发生概率显著增加,云服务商必须考虑鲁棒的应急措施来应对这些必然的故障。常见的恢复方法是重新启动LLM服务实例;然而,在模型即服务(MaaS)推理场景中,这会因重新加载模型权重和重新编译计算图而引入显著延迟,影响后续请求。我们提出ReviveMoE,一种在不重启服务实例的情况下实现大规模LLM部署快速故障恢复的方法。ReviveMoE旨在支持传统LLM架构(即MoE与注意力在同一硬件上共定位),也支持分离MoE与注意力的解聚合架构。该系统集成于华为云的MaaS平台,构建于华为的xDeepServe服务平台和XCCL通信库之上。

关键词

引用

@article{arxiv.2602.21140,
  title  = {ReviveMoE: Fast Recovery for Hardware Failures in Large-Scale MoE LLM Inference Deployments},
  author = {Haley Li and Xinglu Wang and Cong Feng and Chunxu Zuo and Yanan Wang and Hei Lo and Yufei Cui and Bingji Wang and Duo Cui and Shuming Jing and Yizhou Shan and Ying Xiong and Jiannan Wang and Yong Zhang and Zhenan Fan},
  journal= {arXiv preprint arXiv:2602.21140},
  year   = {2026}
}

备注

21 pages, 6 figures