中文

RailS:分布式Mixture-of-Experts训练中面向All-to-All通信的负载均衡

分布式、并行与集群计算 2025-10-24 v2 网络与互联网体系结构

摘要

Mixture-of-Experts(MoE)模型训练引入稀疏且高度不平衡的all-to-all通信,主导迭代时间。传统负载均衡方法未充分利用Rail架构的确定性拓扑特性,导致多NIC带宽未被充分利用。本文提出RailS,一种分布式负载均衡框架,用于最小化MoE训练中的all-to-all完成时间。RailS利用Rail拓扑的对称性,证明均匀发送可实现均匀接收,将全局协调转化为局部调度。每个节点独立执行最长处理时间优先(LPT)喷雾调度器,以本地信息主动平衡流量。RailS激活N条平行轨道,实现细粒度的拓扑感知多路径传输。在综合和真实世界的MoE工作负载测试中,RailS将总线带宽提升20%--78%,完成时间缩短17%--78%。对于Mixtral工作负载,迭代时间缩短18%--40%,实现近乎最优的负载平衡,充分发挥分布式训练中架构的并行性。

关键词

引用

@article{arxiv.2510.19262,
  title  = {RailS: Load Balancing for All-to-All Communication in Distributed Mixture-of-Experts Training},
  author = {Heng Xu and Zhiwei Yu and Chengze Du and Ying Zhou and Letian Li and Haojie Wang and Weiqiang Cheng and Jialong Li},
  journal= {arXiv preprint arXiv:2510.19262},
  year   = {2025}
}