中文

迈向实用的少样本联邦自然语言处理

计算与语言 2023-08-22 v2 机器学习

摘要

基于 Transformer 的预训练模型已成为自然语言处理(NLP)的主流解决方案。为下游任务微调此类预训练模型通常需要大量带标签的私有数据。在实践中,私有数据通常分布在异构移动设备上,且可能被禁止上传。此外,经过精心标注的数据通常很稀缺,这带来了额外的挑战。为了应对这些挑战,我们首先引入了一个用于联邦少样本学习任务的数据生成器,它涵盖了现实设定下稀缺标注数据的数量和偏度。随后,我们提出了 AUG-FedPrompt,一个基于提示的联邦学习系统,利用大量未标注数据进行数据增强。我们的实验表明,AUG-FedPrompt 在标注数据有限的情况下,其性能可以与全量微调相媲美。然而,这种有竞争力的性能伴随着显著的系统开销。

关键词

引用

@article{arxiv.2212.00192,
  title  = {Towards Practical Few-shot Federated NLP},
  author = {Dongqi Cai and Yaozong Wu and Haitao Yuan and Shangguang Wang and Felix Xiaozhu Lin and Mengwei Xu},
  journal= {arXiv preprint arXiv:2212.00192},
  year   = {2023}
}

备注

EuroSys23 workshop