中文

跨设备联邦学习中语言模型规模的扩展

计算与语言 2022-06-28 v2 机器学习

摘要

由于服务器-客户端通信与设备端计算瓶颈,多数跨设备联邦学习研究聚焦于小模型。本工作中,我们利用多种缓解这些瓶颈的技术,在跨设备联邦学习中训练更大的语言模型。通过系统性地应用部分模型训练、量化、高效迁移学习以及通信高效优化器,我们能够训练具有21M参数的Transformer和20.2M参数的Conformer,其困惑度达到或优于同等规模的LSTM,且客户端到服务器通信成本降低约10倍,困惑度比文献中常研究的小规模LSTM低11%。

关键词

引用

@article{arxiv.2204.09715,
  title  = {Scaling Language Model Size in Cross-Device Federated Learning},
  author = {Jae Hun Ro and Theresa Breiner and Lara McConnaughey and Mingqing Chen and Ananda Theertha Suresh and Shankar Kumar and Rajiv Mathews},
  journal= {arXiv preprint arXiv:2204.09715},
  year   = {2022}
}