HOBBIT:用于快速MoE推理的混合精度专家卸载系统
机器学习
2024-11-07 v2 分布式、并行与集群计算
摘要
专家混合(MoE)架构在大语言模型(LLM)时代已展现出显著优势,以降低的推理成本提供增强的能力。然而,在内存受限的边缘设备上部署基于MoE的LLM仍然具有挑战性,因为其内存需求巨大。虽然现有的专家卸载方法缓解了内存需求,但它们通常会产生显著的专家加载代价或损害模型准确性。我们提出HOBBIT,一个混合精度专家卸载系统,以实现灵活高效的MoE推理。我们的关键洞察是,动态替换不太关键的缓存未命中专家为低精度版本可以大幅降低专家加载延迟,同时保持模型准确性。HOBBIT引入了三种创新技术来映射MoE计算的自然层次结构:(1)令牌级动态专家加载机制,(2)层级自适应专家预取技术,以及(3)序列级多维专家缓存策略。这些创新充分利用了混合精度专家推理的优势。通过在著名的LLM推理框架Llama.cpp之上实现HOBBIT,我们在具有代表性MoE模型的不同边缘设备上评估了其性能。结果表明,HOBBIT在解码速度上相比最先进的MoE卸载系统实现了高达9.93倍的加速。
引用
@article{arxiv.2411.01433,
title = {HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference},
author = {Peng Tang and Jiacheng Liu and Xiaofeng Hou and Yifei Pu and Jing Wang and Pheng-Ann Heng and Chao Li and Minyi Guo},
journal= {arXiv preprint arXiv:2411.01433},
year = {2024}
}