Fate:基于跨层门控的 Mixture-of-Experts 模型快速边缘推理
人工智能
2025-05-08 v2 机器学习
摘要
大型语言模型(LLMs)在各类任务中展现出惊人的性能,其在边缘场景的应用也引起了广泛关注。然而,稀疏激活的 Mixture-of-Experts(MoE)模型因内存需求较大,尽管适合边缘场景,却受到较少关注。卸载式方法已提出以解决此挑战,但面临专家预测困难的问题。准确的专家预测不足会导致推理延迟延长。为促进MoE模型在边缘场景的应用,我们提出Fate,一种为MoE模型设计的卸载系统,以实现资源受限环境下的高效推理。Fate的关键思想在于,利用相邻层的门控输入可有效用于专家预取,在无需额外GPU开销的情况下实现高预测准确率。此外,Fate采用浅层优先的专家缓存策略,将专家命中率提升至99%。此外,Fate集成了针对缓存优化和IO效率的量化策略。实验结果表明,与Load on Demand 和基于专家激活路径的方法相比,Fate在预填速度上实现最高可达4.5倍和1.9倍的加速,在解码速度上实现最高可达4.1倍和2.2倍的加速,同时保持推理质量。且Fate的性能改进在不同内存预算下均具有可扩展性。
关键词
引用
@article{arxiv.2502.12224,
title = {Fate: Fast Edge Inference of Mixture-of-Experts Models via Cross-Layer Gate},
author = {Zhiyuan Fang and Zicong Hong and Yuegui Huang and Yufeng Lyu and Wuhui Chen and Yue Yu and Fan Yu and Zibin Zheng},
journal= {arXiv preprint arXiv:2502.12224},
year = {2025}
}