迈向实用的少样本联邦自然语言处理
计算与语言
2023-08-22 v2 机器学习
摘要
基于 Transformer 的预训练模型已成为自然语言处理(NLP)的主流解决方案。为下游任务微调此类预训练模型通常需要大量带标签的私有数据。在实践中,私有数据通常分布在异构移动设备上,且可能被禁止上传。此外,经过精心标注的数据通常很稀缺,这带来了额外的挑战。为了应对这些挑战,我们首先引入了一个用于联邦少样本学习任务的数据生成器,它涵盖了现实设定下稀缺标注数据的数量和偏度。随后,我们提出了 AUG-FedPrompt,一个基于提示的联邦学习系统,利用大量未标注数据进行数据增强。我们的实验表明,AUG-FedPrompt 在标注数据有限的情况下,其性能可以与全量微调相媲美。然而,这种有竞争力的性能伴随着显著的系统开销。
引用
@article{arxiv.2212.00192,
title = {Towards Practical Few-shot Federated NLP},
author = {Dongqi Cai and Yaozong Wu and Haitao Yuan and Shangguang Wang and Felix Xiaozhu Lin and Mengwei Xu},
journal= {arXiv preprint arXiv:2212.00192},
year = {2023}
}
备注
EuroSys23 workshop