中文

MoE-DisCo:低经济成本训练混合专家模型

机器学习 2026-01-13 v1 人工智能

摘要

大规模混合专家(MoE)模型训练通常需要高内存、高带宽的GPU(如A100),其高昂成本已成为大规模模型训练的主要障碍。相比之下,低成本硬件受限于内存容量和带宽,难以直接进行LLM训练。为此,我们提出MoE-DisCo(混合专家与解耦聚类与协调),是一个分阶段的训练框架。MoE-DisCo将MoE模型分解为多个稠密子模型,每个子模型由共享 backbone和单个专家组成,通过无监督聚类将训练数据划分为子集。每个子模型在其分配的数据子集上使用低成本设备独立并行训练,无需任何设备间通信。随后,将所有专家集成到完整的MoE模型中,并在高内存、高带宽GPU上进行短暂的全局微调。实验表明,我们的方法在多个下游任务、损失函数和每词汇率(PPL)方面表现出与全参数训练相当甚至更好的性能,同时在Qwen1.5-MoE-2.7B和Llama-MoE-3.5B上训练成本降低47.6%至69.5%。

关键词

引用

@article{arxiv.2601.06857,
  title  = {MoE-DisCo:Low Economy Cost Training Mixture-of-Experts Models},
  author = {Xin Ye and Daning Cheng and Boyang Zhang and Yunquan Zhang},
  journal= {arXiv preprint arXiv:2601.06857},
  year   = {2026}
}