中文

MobiZO:面向边缘设备的高效 LLM 微调

机器学习 2025-09-23 v3 分布式、并行与集群计算

摘要

大型语言模型 (LLM) 目前是在大型云服务器上进行预训练和微调的。下一个前沿是 LLM 个性化,即基础模型可以用用户/任务特定数据进行微调。鉴于这种私有数据的敏感性,能够在边缘设备上进行微调以提高用户信任是理想的。然而,由于巨大的内存和计算需求以及有限的基础设施支持,在资源受限的边缘设备上进行微调 presents significant 挑战。我们注意到,推理引擎(如 ExecuTorch)可以利用零阶 (ZO) 优化进行微调,该方法通过多个前向传播来近似梯度。虽然这个方法前景光明,但直接在边缘设备上应用 ZO 方法效率低下,由于计算成本高昂的多个前向传播用于准确梯度估计,且在实际中其部署 largely 尚未得到探索。我们引入 MobiZO,一个专为边缘设备设计的 LLM 资源高效微调框架。MobiZO 结合了三个关键创新:(1) 一个并行化的随机梯度估计器,通过采用外循环和内循环并行性来消除顺序的前向传播;(2) 一个专门的 Multi-Perturbed LoRA (MP-LoRA) 模块,有效实现内循环和外循环的并行性;(3)与 ExecuTorch 的无缝集成,实现设备端训练,无需修改运行时。实验表明,MobiZO 在保持较好微调精度的同时,实现了显著的运行时加速和内存节省,为在实际场景中部署 LLM 铺平了实时设备端应用的道路。

关键词

引用

@article{arxiv.2409.15520,
  title  = {MobiZO: Enabling Efficient LLM Fine-Tuning at the Edge via Inference Engines},
  author = {Lei Gao and Amir Ziashahabi and Yue Niu and Salman Avestimehr and Murali Annavaram},
  journal= {arXiv preprint arXiv:2409.15520},
  year   = {2025}
}