OpenFedLLM:通过联邦学习在分布式私有数据上训练大型语言模型
机器学习
2024-02-13 v1 计算与语言
分布式、并行与集群计算
多智能体系统
摘要
大型语言模型(LLM)是在大规模公开数据上训练的,已在多个领域展示了巨大成功。尽管更多数据有助于更好性能,但令人关切的现实是,高质量公开数据在未来几年内将枯竭。本文提供了一种潜在的下一步:通过联邦学习(Federated Learning, FL)在利用不足的分布式私有数据上协作训练共享模型,而不传输原始数据。为实现这一目标,我们构建了一个简洁、集成且具有研究友好性的框架/代码库,命名为OpenFedLLM。它涵盖了通过联邦学习进行指令调谐以增强指令跟随能力、通过联邦学习进行价值对齐以符合人类价值观,以及7种代表性联邦学习算法。此外,OpenFedLLM支持在多个领域进行训练,我们覆盖了8个训练数据集;并提供了全面的评估,覆盖30多个评估指标。通过大量实验,我们观察到所有联邦学习算法都优于本地训练,表现出清晰的性能提升,适用于各种设置。在金融基准测试中,采用任何联邦学习算法微调的Llama2-7B模型可显著优于GPT-4,而通过单独训练获得的模型则无法实现这一点,充分展示了客户参与联邦学习的强大动机。代码已公开于https://github.com/rui-ye/OpenFedLLM。
关键词
引用
@article{arxiv.2402.06954,
title = {OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning},
author = {Rui Ye and Wenhao Wang and Jingyi Chai and Dihan Li and Zexi Li and Yinda Xu and Yaxin Du and Yanfeng Wang and Siheng Chen},
journal= {arXiv preprint arXiv:2402.06954},
year = {2024}
}
备注
28 pages, 3 figures, 16 tables