MoE-PHDS:一个支持灵活运行时稀疏性的MoE检查点
机器学习
2025-09-30 v1 人工智能
摘要
稀疏混合专家(MoE)模型通常被训练为在固定的稀疏性水平下运行,例如top-门控函数中的。这个全局稀疏性水平决定了准确率/延迟曲线上的一个工作点;目前,满足多个效率目标意味着需要训练和维护多个模型。这种做法使服务变得复杂,增加了训练和维护成本,并限制了满足多样化延迟、效率和能耗需求的灵活性。我们证明,预训练的MoE模型对运行时稀疏性变化的鲁棒性比通常认为的要高,并引入了MoE-PHDS(事后声明稀疏性),这是一种轻量级的监督微调(SFT)方法,可将单个检查点转变为一个全局稀疏性控制面。PHDS混合了不同稀疏性水平的训练,并在高稀疏性下使用短课程进行锚定,无需任何架构更改。其结果是,从一个模型即可获得可预测的准确率/延迟权衡:从业者可以在推理时“调节”,而无需交换检查点、更改架构或依赖令牌级启发式方法。在OLMoE-1B-7B-0125、Qwen1.5-MoE-A2.7B以及适配多个工作点的专有模型上的实验表明,PHDS的性能匹配或优于良好指定的预言机模型,与良好指定的预言机模型相比,跨稀疏性一致性提升高达22%,并通过将全局稀疏性作为一等服务原语,实现了简化、灵活的运行时MoE部署。
引用
@article{arxiv.2509.23012,
title = {MoE-PHDS: One MoE checkpoint for flexible runtime sparsity},
author = {Lauren. A Hannah and Soheil Zibakhsh and Kumari Nishu and Arnav Kundu and Mohammad Samragh Razlighi and Mehrdad Farajtabar and Minsik Cho},
journal= {arXiv preprint arXiv:2509.23012},
year = {2025}
}