WDMoE:用于大语言模型的无线分布式专家混合模型
机器学习
2024-11-12 v1 人工智能
分布式、并行与集群计算
信息论
math.IT
摘要
大语言模型(LLMs)在各种自然语言处理任务中取得了显著成功,但无线网络在支持 LLMs 中的作用尚未得到充分探索。在本文中,我们提出了一种无线分布式专家混合(WDMoE)架构,以实现 LLMs 在基站(BS)边缘服务器和无线网络中移动设备之间的协同部署。具体来说,我们通过将门控网络和前馈神经网络层放置在基站上,而将专家网络分布在设备上,来分解 LLMs 中的 MoE 层。这种部署利用了移动设备上专家网络的并行推理能力,有效利用了这些设备有限的计算和缓存资源。因此,我们为基于 WDMoE 的 LLMs 开发了一种性能指标,该指标同时考虑了模型能力和延迟。为了在保持精度的同时最小化延迟,我们基于该性能指标联合优化了专家选择和带宽分配。此外,我们使用 NVIDIA Jetson 套件构建了硬件测试平台以验证 WDMoE 的有效性。理论模拟和实际硬件实验均表明,所提出的方法可以显著降低延迟而不损害 LLM 性能。
引用
@article{arxiv.2411.06681,
title = {WDMoE: Wireless Distributed Mixture of Experts for Large Language Models},
author = {Nan Xue and Yaping Sun and Zhiyong Chen and Meixia Tao and Xiaodong Xu and Liang Qian and Shuguang Cui and Wenjun Zhang and Ping Zhang},
journal= {arXiv preprint arXiv:2411.06681},
year = {2024}
}