中文

FedMKT:面向大型和小型语言模型的联邦相互知识传递

计算与语言 2024-12-17 v4 人工智能

摘要

近期的联邦大型语言模型(LLMs)研究主要聚焦于使客户端能够协作式微调其本地部署的同构LLMs,或将服务器端LLMs的知识传递给下游客户端的小型语言模型(SLMs)。然而,服务器LLMs与客户端SLMs的同步相互提升仍存在显著鸿沟。为弥合这一鸿沟,我们提出FedMKT——一种面向大型和小型语言模型的参数高效联邦相互知识传递框架。该框架旨在适配性地将服务器LLMs的知识传递给客户端SLMs,同时丰富LLMs以吸收客户端独特的领域洞见。我们通过最小编辑距离(MinED)实现token对齐,然后在客户端SLMs与服务器端LLMs之间进行选择性相互知识传递,以期协同提升二者性能。通过在三种不同场景下的大规模实验,我们评估了FedMKT在多种公共LLMs和SLMs上进行的NLP文本生成任务的有效性。经验结果表明,FedMKT同时提升了LLMs和SLMs的性能。

关键词

引用

@article{arxiv.2406.02224,
  title  = {FedMKT: Federated Mutual Knowledge Transfer for Large and Small Language Models},
  author = {Tao Fan and Guoqiang Ma and Yan Kang and Hanlin Gu and Yuanfeng Song and Lixin Fan and Kai Chen and Qiang Yang},
  journal= {arXiv preprint arXiv:2406.02224},
  year   = {2024}
}