中文

FedLLM-Bench: 大型语言模型联邦学习的现实基准

计算与语言 2024-06-10 v1 人工智能 分布式、并行与集群计算 机器学习 多智能体系统

摘要

联邦学习使得多方能够在不直接共享数据的情况下协作训练大型语言模型(FedLLM)。遵循这一训练范式,社区在框架、性能和隐私等多个方面付出了巨大努力。然而,一个令人不快的现实是,目前没有用于FedLLM的真实数据集和基准,以往的工作都依赖于人工构建的数据集,未能捕捉真实场景中的特性。针对这一点,我们提出了FedLLM-Bench,它涉及8种训练方法、4个训练数据集和6个评估指标,为FedLLM社区提供了一个全面的测试平台。FedLLM-Bench包含三个数据集(例如,用户标注的多语言数据集)用于联邦指令微调,以及一个数据集(例如,用户标注的偏好数据集)用于联邦偏好对齐,其客户端数量范围从38到747。我们的数据集包含了几个代表性的多样性:语言、质量、数量、指令、长度、嵌入和偏好,捕捉了真实场景中的特性。基于FedLLM-Bench,我们在所有数据集上进行了实验,以基准测试现有的联邦学习方法,并提供经验性见解(例如,多语言协作)。我们相信,我们的FedLLM-Bench可以通过减少所需工作量、提供实用测试平台和促进公平比较来惠及FedLLM社区。代码和数据集可在https://github.com/rui-ye/FedLLM-Bench获取。

关键词

引用

@article{arxiv.2406.04845,
  title  = {FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models},
  author = {Rui Ye and Rui Ge and Xinyu Zhu and Jingyi Chai and Yaxin Du and Yang Liu and Yanfeng Wang and Siheng Chen},
  journal= {arXiv preprint arXiv:2406.04845},
  year   = {2024}
}

备注

22 pages