EC2MoE:面向可扩展混合专家推理的自适应端云管线协作
分布式、并行与集群计算
2025-08-11 v1
摘要
混合专家 (MoE) 范式已成为在保持推理效率的同时扩展模型容量的有前景解决方案。然而,在异构端云环境中部署 MoE 模型面临专家调度、通信开销和资源异构性等新挑战。本文提出 EC2MoE,一种用于端云管线协作的可扩展 MoE 推理自适应框架。首先,我们设计了硬件感知的轻量级组门网络,以增强专家选择和计算效率。通过纳入硬件感知的本地专家选择机制,系统可根据实时设备配置自适应筛选候选专家。随后,轻量级组门模块整合本地和全局门控输出,以实现最小开销的高质量专家路由。其次,我们开发了基于端云协作的管线优化机制,以加快 MoE 推理速度。这包括基于低秩压缩的编码器-解码器结构,以减少传输和计算成本。以及一种基于路由感知的启发式管线调度算法,可根据工作负载和网络拓扑动态分配推理阶段。大量实验表明,EC2MoE 可将吞吐量提高 2.2 倍至 5.1 倍,将端到端延迟降低 53% 至 67%,同时保持与最先进方法的高准确率。它在动态负载和网络环境下也能保持良好的可扩展性。
引用
@article{arxiv.2508.06024,
title = {EC2MoE: Adaptive End-Cloud Pipeline Collaboration Enabling Scalable Mixture-of-Experts Inference},
author = {Zheming Yang and Yunqing Hu and Sheng Sun and Wen Ji},
journal= {arXiv preprint arXiv:2508.06024},
year = {2025}
}
备注
9 pages, 8 figures