EdgeMoE:赋能移动设备上的稀疏大语言模型
机器学习
2025-03-10 v2 人工智能
计算与语言
摘要
诸如 GPT 与 Mixtral-8x7B 的大语言模型(LLMs)因其于通用 ML 任务中的卓越能力而革新了机器智能。将 LLM 从数据中心迁移至边缘设备带来了更好的隐私性与可用性等优势,但却受其庞大参数规模及因此难以承受的运行成本所挑战。为此,我们提出 EdgeMoE,一种面向混合专家(MoE)LLM 的设备端推理引擎——MoE LLM 是一种流行的稀疏 LLM 形式,其以近乎恒定的计算复杂度扩展参数规模。EdgeMoE 通过将模型划分至存储层次结构实现内存与计算效率:非专家权重驻留于设备内存;专家权重存于外部存储,仅在激活时调入内存。该设计源于一项关键观察,即专家权重庞大但因稀疏激活而使用不频繁。为进一步降低专家 I/O 交换开销,EdgeMoE 引入两项新技术:(1)专家级位宽自适应,以可容忍的精度损失缩减专家尺寸;(2)专家预加载,提前预测激活专家并随计算-I/O 流水线预载之。在主流 MoE LLM 与边缘设备上,EdgeMoE 相较竞争基线展现出显著内存节省与加速。代码见 https://github.com/UbiquitousLearning/mllm。
引用
@article{arxiv.2308.14352,
title = {EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices},
author = {Rongjie Yi and Liwei Guo and Shiyun Wei and Ao Zhou and Shangguang Wang and Mengwei Xu},
journal= {arXiv preprint arXiv:2308.14352},
year = {2025}
}