FedAttr:面向联邦LLM微调中保护隐私的客户端级归因
密码学与安全
2026-05-08 v1 机器学习
摘要
水印放射性测试类方法能够检测模型是否基于带水印的文档进行训练,并已成为保护大型语言模型(LLM)微调中数据所有权的关键工具。现有工作已证明其在集中式 LLM 微调中的有效性。然而,这类方法在联邦学习(FL)中面临诸多挑战且尚待深入探索;联邦学习是一种被广泛应用的范式,用于在不同用户的私有数据上协作微调 LLM。FL 主要通过安全聚合(SA)来确保隐私,该机制允许服务器在聚合更新的同时保持客户端的更新私密。这种机制保护了隐私,但也使得难以识别哪个客户端使用了带水印的文档进行训练。在本工作中,我们提出了 FedAttr,一种用于 FL 的全新客户端级归因协议。FedAttr 通过配对子集差分机制识别哪些客户端基于带水印的数据进行训练,同时保留 SA 的隐私保证和 FL 性能。FedAttr 分三步进行: 通过两次 SA 查询的差分来估计每个客户端的更新; 通过差分评分用水印检测器对估计进行评分; 通过 Stouffer 方法跨轮次合并分数。我们从理论上证明,FedAttr 能产生每个客户端更新的无偏估计,且互信息泄露有界(即每轮更新泄露为 )。此外,FedAttr 在经验上实现了 100% 的 TPR 和 0% 的 FPR,以仅 6.3% 的 FL 训练时间开销,在 TPR 上超越所有基线至少 44.4%,或在 FPR 上超越 19.1%。消融研究证实 FedAttr 对协议参数和配置具有鲁棒性。
引用
@article{arxiv.2605.06596,
title = {FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning},
author = {Su Zhang and Junfeng Guo and Heng Huang},
journal= {arXiv preprint arXiv:2605.06596},
year = {2026}
}
备注
39 pages, 4 figures, 21 tables (including appendix)