中文

基于合成数据的联邦领域特定知识迁移至大语言模型

密码学与安全 2024-05-24 v1 计算与语言

摘要

随着大语言模型(LLM)展现出无与伦比的性能和泛化能力,LLM被广泛使用并集成到各种应用中。当涉及敏感领域时,如联邦学习场景中常见的那样,直接在私有数据上使用外部LLM受到严格的数据安全和隐私法规的禁止。对于本地客户端,利用LLM来改进领域特定的小语言模型(SLM),其特点是计算资源和领域特定数据有限,已引起广泛研究关注。通过观察到LLM可以赋能领域特定的SLM,现有方法主要集中在利用公共数据或LLM生成更多数据,以将知识从LLM迁移到SLM。然而,由于LLM生成的数据与客户端领域特定数据之间存在差异,这些方法无法在领域特定任务上产生实质性改进。在本文中,我们介绍了一种联邦领域特定知识迁移(FDKT)框架,该框架能够在保护客户端数据隐私的同时,实现从LLM到SLM的领域特定知识迁移。核心思想是利用LLM基于领域特定的少样本演示来增强数据,这些演示是通过差分隐私从私有领域数据中合成的。这样的合成样本与客户端的私有数据具有相似的数据分布,并允许服务器LLM生成特定知识来改进客户端的SLM。广泛的实验结果表明,与在私有数据上进行本地训练相比,所提出的FDKT框架在隐私预算小于10的情况下,持续且显著地将SLM的任务性能提高了约5%。

关键词

引用

@article{arxiv.2405.14212,
  title  = {Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data},
  author = {Haoran Li and Xinyuan Zhao and Dadi Guo and Hanlin Gu and Ziqian Zeng and Yuxing Han and Yangqiu Song and Lixin Fan and Qiang Yang},
  journal= {arXiv preprint arXiv:2405.14212},
  year   = {2024}
}