跨设备联邦学习中语言模型规模的扩展
计算与语言
2022-06-28 v2 机器学习
摘要
由于服务器-客户端通信与设备端计算瓶颈,多数跨设备联邦学习研究聚焦于小模型。本工作中,我们利用多种缓解这些瓶颈的技术,在跨设备联邦学习中训练更大的语言模型。通过系统性地应用部分模型训练、量化、高效迁移学习以及通信高效优化器,我们能够训练具有21M参数的Transformer和20.2M参数的Conformer,其困惑度达到或优于同等规模的LSTM,且客户端到服务器通信成本降低约10倍,困惑度比文献中常研究的小规模LSTM低11%。
引用
@article{arxiv.2204.09715,
title = {Scaling Language Model Size in Cross-Device Federated Learning},
author = {Jae Hun Ro and Theresa Breiner and Lara McConnaughey and Mingqing Chen and Ananda Theertha Suresh and Shankar Kumar and Rajiv Mathews},
journal= {arXiv preprint arXiv:2204.09715},
year = {2022}
}