大型语言模型在资源受限设备上的高效部署
机器学习
2025-01-07 v1 人工智能
计算与语言
分布式、并行与集群计算
摘要
在资源受限(或弱)设备上部署大型语言模型(LLM)由于资源有限和数据分布异质性而面临重大挑战。为了解决数据问题,需要使用设备上的私有数据对LLM进行微调以适应各种下游任务。虽然联邦学习(FL)提供了一种有前景的隐私保护解决方案,但现有的微调方法保留了原始LLM大小,导致高推理延迟和过多内存需求的问题未解决。因此,我们设计了FedSpine,一个结合参数高效微调(PEFT)和结构化剪枝的FL框架,用于在资源受限设备上高效部署LLM。具体地,FedSpine引入了一个迭代过程来剪枝和调整LLM的参数。为了减轻设备异质性的影响,采用在线多臂老虎机(MAB)算法自适应地确定异质设备的不同剪枝比率和LoRA秩,无需任何关于其计算和通信能力的先验知识。结果,FedSpine在提高微调效率的同时保持了更高的推理精度。在包含80个设备的物理平台上进行的实验结果表明,与其他基线相比,在相同稀疏度水平下,FedSpine可以将微调速度提高1.4倍至6.9倍,并将最终精度提高0.4%至4.5%。
引用
@article{arxiv.2501.02438,
title = {Efficient Deployment of Large Language Models on Resource-constrained Devices},
author = {Zhiwei Yao and Yang Xu and Hongli Xu and Yunming Liao and Zuan Xie},
journal= {arXiv preprint arXiv:2501.02438},
year = {2025}
}