迈向联邦基础模型:面向组结构学习的可扩展数据集流水线
机器学习
2023-12-25 v2 分布式、并行与集群计算
摘要
我们介绍Dataset Grouper,一个用于创建大规模组结构(如联邦)数据集的库,支持以基础模型规模进行联邦学习仿真。该库便于基于用户指定划分创建现有数据集的组结构版本,并直接产生可插入现有软件框架的多种有用异构数据集。Dataset Grouper提供三个关键优势。首先,它可扩展至即便单个组的数据集也过大而无法装入内存的设定。其次,它提供灵活性,既在选用基础(未划分)数据集上,也在定义划分上。最后,它是框架无关的。我们实证表明,Dataset Grouper能够在比以往工作大数个量级的数据集上实现大规模联邦语言建模仿真,允许对具数亿乃至数十亿参数的语言模型进行联邦训练。我们的实验结果显示,在此规模下FedAvg等算法更似元学习方法而非经验风险最小化方法,暗示其在下游个性化与任务特定适配中的效用。Dataset Grouper可在 https://github.com/google-research/dataset_grouper 获取。
引用
@article{arxiv.2307.09619,
title = {Towards Federated Foundation Models: Scalable Dataset Pipelines for Group-Structured Learning},
author = {Zachary Charles and Nicole Mitchell and Krishna Pillutla and Michael Reneer and Zachary Garrett},
journal= {arXiv preprint arXiv:2307.09619},
year = {2023}
}
备注
Dataset Grouper is available at https://github.com/google-research/dataset_grouper