面向大语言模型微调的联邦学习扩展
机器学习
2021-02-02 v1 计算与语言
分布式、并行与集群计算
摘要
联邦学习(FL)是一种针对分布式计算与分布式数据的前景广阔的方法,并为法律框架提供了一定程度的隐私与合规性。这使得FL在消费级与医疗应用中颇具吸引力。尽管该领域正被积极研究,但极少有研究在较大语言模型的背景下考察FL,且缺乏跨任务、架构、客户端数量及其他相关因素鲁棒性的全面综述。本文中,我们探索了联邦学习设定下基于Transformer的语言模型的微调。我们在若干文本分类任务(如情感分析与作者识别)上评估了三种不同规模的流行BERT变体(BERT、ALBERT与DistilBERT)。我们对客户端数量进行了广泛扫描,最多达32个,以评估分布式计算在联邦平均设定下对任务性能的影响。尽管我们的发现表明所评估模型的大规模通常并不妨碍联邦训练,但我们发现不同模型对联邦平均的承受程度各异。最值得注意的是,DistilBERT在客户端数量较大时收敛显著更慢,且在某些情况下甚至崩塌至随机水平性能。探究此问题为未来研究提供了一个有趣的视角。
引用
@article{arxiv.2102.00875,
title = {Scaling Federated Learning for Fine-tuning of Large Language Models},
author = {Agrin Hilmkil and Sebastian Callh and Matteo Barbieri and Leon René Sütfeld and Edvin Listo Zec and Olof Mogren},
journal= {arXiv preprint arXiv:2102.00875},
year = {2021}
}