中文

通信成本低于18 KB的十亿级语言模型联邦全参数微调

机器学习 2024-05-28 v5 分布式、并行与集群计算

摘要

预训练大语言模型(LLMs)需要微调以改善其对自然语言指令的响应能力。联邦学习提供了一种利用终端设备上丰富数据微调LLMs而不损害数据隐私的方法。现有大多数面向LLMs的联邦微调方法依赖于参数高效微调技术,这些技术可能无法达到全参数微调所能实现的性能高度。然而,由于巨大的通信成本,LLMs的联邦全参数微调是一个非平凡问题。本文引入了FedKSeed,它采用零阶优化与一组有限随机种子。它将服务器和客户端之间的传输需求显著降低至仅需少量随机种子和标量梯度,总计仅几千字节,使得在设备上对十亿级LLMs进行联邦全参数微调成为可能。在此基础上,我们开发了一种策略,实现概率差异化种子采样,优先考虑对模型精度影响更大的扰动。跨越六种场景、使用多种LLMs、数据集和数据划分的实验表明,我们的方法在通信效率和新任务泛化方面均优于现有的联邦LLM微调方法。

关键词

引用

@article{arxiv.2312.06353,
  title  = {Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 Kilobytes},
  author = {Zhen Qin and Daoyuan Chen and Bingchen Qian and Bolin Ding and Yaliang Li and Shuiguang Deng},
  journal= {arXiv preprint arXiv:2312.06353},
  year   = {2024}
}

备注

Accepted to ICML 2024. 25 pages, 14 figures, 7 tables. Codes are available at https://github.com/alibaba/FederatedScope/tree/FedKSeed