联邦学习能否保护 LLM 训练中的私有数据?漏洞、攻击与防御评估
机器学习
2025-09-26 v1 计算与语言
密码学与安全
摘要
使用本地数据微调大型语言模型(LLM)是各组织寻求将 LLM 适配到其特定领域的广泛采用的方法。鉴于不同组织之间的数据具有共享特征,利用多个来源的数据协作微调 LLM 呈现出一个引人注目的机会。然而,组织往往不愿共享本地数据,使得集中式微调不切实际。联邦学习(FL)作为一种隐私保护框架,使客户端能够保留本地数据同时仅共享模型参数进行协作训练,提供了一种潜在的解决方案。虽然在集中式数据集上微调 LLM 会通过下一词预测面临数据泄露风险,但 FL 中的迭代聚合过程会产生一个封装了泛化知识的全局模型,一些人认为这保护了客户端隐私。然而,在本文中,我们通过大量实验展示了相互矛盾的结果。我们表明,攻击者仍然可以从全局模型中提取训练数据,即使使用简单的生成方法,且随着模型规模的增大,泄露程度加剧。此外,我们提出了一种专门针对 FL 的增强攻击策略,通过在训练过程中追踪全局模型更新来加剧隐私泄露。为了缓解这些风险,我们评估了 FL 中的隐私保护技术,包括差分隐私、正则化约束更新以及采用具有安全对齐的 LLM。我们的结果为降低使用 FL 训练 LLM 时的隐私风险提供了有价值的见解和实用指南。
引用
@article{arxiv.2509.20680,
title = {Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation},
author = {Wenkai Guo and Xuefeng Liu and Haolin Wang and Jianwei Niu and Shaojie Tang and Jing Yuan},
journal= {arXiv preprint arXiv:2509.20680},
year = {2025}
}
备注
28 pages, 32 figures, accepted to the Findings of EMNLP 2025