中文

联邦学习在生物医学自然语言处理上的深入评估

计算与语言 2023-11-14 v2

摘要

BERT与GPT等语言模型(LMs)已彻底改变了自然语言处理(NLP)。然而,由于《健康保险流通与责任法案》(HIPPA)与《通用数据保护条例》(GDPR)等法规带来的数据访问受限与隐私约束,医疗领域在训练语言模型方面面临挑战。联邦学习(FL)提供了一种去中心化解决方案,可在确保数据隐私的同时实现协作学习。在本研究中,我们使用6种语言模型在涵盖8个语料的2项生物医学NLP任务上评估了FL。我们的结果表明:1) FL模型持续优于基于各客户端单独数据训练的模型,且有时与汇总数据训练的模型表现相当;2) 在总数据量固定时,以更多客户端训练的FL模型性能更差,但预训练的基于transformer的模型表现出极强韧性;3) FL模型显著优于采用零样本/单样本学习的大语言模型(LLM),并提供极速推理。

关键词

引用

@article{arxiv.2307.11254,
  title  = {An In-Depth Evaluation of Federated Learning on Biomedical Natural Language Processing},
  author = {Le Peng and Gaoxiang Luo and sicheng zhou and jiandong chen and Rui Zhang and Ziyue Xu and Ju Sun},
  journal= {arXiv preprint arXiv:2307.11254},
  year   = {2023}
}

备注

Accepted by KDD 2023 Workshop FL4Data-Mining