中文

FwdLLM:基于前向梯度的联邦大语言模型高效训练

人工智能 2024-01-23 v2 机器学习

摘要

大语言模型(LLMs)正在改变移动智能的格局。联邦学习(FL)作为一种保护用户数据隐私的方法,常被用于微调 LLM 至下游移动任务,该方法被称为 FedLLM。尽管近期工作已解决由庞大模型规模引起的网络问题,但它们尚未切实缓解与移动设备集成相关的重大挑战,如显著的内存消耗和缓慢的模型收敛。为应对这些挑战,本工作引入 FwdLLM,一种旨在提升 FedLLM 效率的创新 FL 协议。FwdLLM 的核心思想是采用无反向传播(BP)的训练方法,仅要求设备执行“扰动推理”。因此,FwdLLM 提供了更好的内存效率和时间效率(由移动 NPU 加速并得益于更多参与设备)。FwdLLM 围绕三个关键设计:(1)将无 BP 训练与参数高效训练方法结合,这是将该方案扩展至 LLM 时代的关键途径;(2)系统且自适应地在设备间分配计算负载,在收敛速度与精度间取得谨慎平衡;(3)区分性采样对模型收敛更有价值的扰动预测。使用五个 LLM 和三个 NLP 任务的全面实验表明,FwdLLM 相较传统方法具有显著优势,包括高达三个数量级的更快收敛和 14.6 倍的内存占用降低。独特的是,FwdLLM 为在商用现货(COTS)移动设备上进行十亿参数 LLM(如 LLaMA)的联邦学习铺平了道路——这是此前未达成的壮举。

关键词

引用

@article{arxiv.2308.13894,
  title  = {FwdLLM: Efficient FedLLM using Forward Gradient},
  author = {Mengwei Xu and Dongqi Cai and Yaozong Wu and Xiang Li and Shangguang Wang},
  journal= {arXiv preprint arXiv:2308.13894},
  year   = {2024}
}

备注

under review