WDMoE:基于混合专家的无线分布式大语言模型
信息论
2024-05-07 v1 人工智能
机器学习
math.IT
摘要
大语言模型(LLMs)在各种自然语言处理任务中取得了显著进展,但如何让无线通信支持 LLMs 仍受到较少关注。本文提出一种基于混合专家(Mixture of Experts, MoE)的无线分布式 LLMs 范式,命名为 WDMoE,在基站(BS)和移动设备的边缘服务器上协作部署 LLMs。具体而言,我们将 LLMs 中的 MoE 层分解,將门控网络和前续神经网络层部署在 BS 上,将专家网络分布在设备上。这种安排利用了专家网络在分布式设备上的并行能力。此外,为了克服无线通信的不稳定性,我们设计了一种专家选择策略,综合考虑模型性能和端到端延迟,后者包括传输延迟和推理延迟。在各种 LLMs 和多个数据集上的评估表明,WDMoE 不仅在现有模型(如拥有 700 亿参数的 Llama 2)方面表现更佳,还显著降低了端到端延迟。
引用
@article{arxiv.2405.03131,
title = {WDMoE: Wireless Distributed Large Language Models with Mixture of Experts},
author = {Nan Xue and Yaping Sun and Zhiyong Chen and Meixia Tao and Xiaodong Xu and Liang Qian and Shuguang Cui and Ping Zhang},
journal= {arXiv preprint arXiv:2405.03131},
year = {2024}
}
备注
submitted to IEEE conference