MoE-Prism:通过模型-系统协同设计解构单体专家以实现弹性 MoE 服务
计算与语言
2025-10-23 v1 机器学习
摘要
混合专家(MoE)模型是大规模人工智能的前沿技术,通过稀疏激活参数实现高质量效果。然而,其依赖通过 top-k 机制在少数单体专家之间进行路由,导致“质量悬崖”,仅提供少数粗粒度的运行点。这种刚性设计迫使在成本与质量之间进行艰难的权衡,阻碍了对多样化服务水平目标(SLO)的适应,并导致显著的资源超配。本文引入了 MoE-Prism,一种模型-系统协同设计,将刚性 MoE 模型转化为弹性服务。我们的 метод论分为两个阶段:第一,离线重构引擎系统性地将单体专家解构为细粒度的“子专家”。该引擎采用基于元启发式的方法的分区优化求解器来对神经元进行分组,保持功能局部性且无需重新训练。第二,线上调度引擎通过这种新的弹性性实现 QoS 感知调度。它实现了针对复杂系统问题的专用策略,包括云端部署中的吞吐量最大化以及面向内存受限设备的延迟优化卸载。我们的评估在三个不同的 MoE 模型上表明,MoE-Prism 能提供超过基线的 4 倍以上不同的、稳定的运行点。这使 AI 服务能在严格的延迟预算下提升至最高 19.9% 的吞吐量,或在资源有限的情况下将延迟降低最高 10.36%。MoE-Prism 为桥接模型-系统鸿沟提供关键“控制旋钮”,使下一代自适应、高效且 QoS 感知的 AI 服务成为可能。
引用
@article{arxiv.2510.19366,
title = {MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs},
author = {Xinfeng Xia and Jiacheng Liu and Xiaofeng Hou and Peng Tang and Mingxuan Zhang and Wenfeng Wang and Chao Li},
journal= {arXiv preprint arXiv:2510.19366},
year = {2025}
}