FedRW:面向增强联邦语言模型学习的高效隐私保留数据重加权
密码学与安全
2025-11-12 v1 人工智能
摘要
大规模语料库中的数据重复常常阻碍大语言模型(LLM)的性能和隐私。在隐私关注的联邦学习场景中,传统去重方法通常依赖可信第三方执行统一删除,既可能导致信息性样本丢失,又会引入隐私漏洞。为此,我们提出了联邦重加权(FedRW),据称是首个在联邦LLM训练中通过样本重加权实现软性去重的隐私保护框架,无需依赖可信第三方。其核心,FedRW通过安全多方计算提出一种安全、频率感知的重加权协议,搭配并行编排策略以确保高效和可扩展性。在训练期间,FedRW利用基于全局样本频率的自适应重加权机制调整单个损失贡献,从而有效改善泛化性和鲁棒性。实验结果表明,FedRW在预处理方面比最新方法实现了最高28.78倍的加速,并实现约11.42%的困惑度提升,同时提供了增强的安全保证。FedRW因此确立了联邦LLM训练中管理重复数据的新范式。
引用
@article{arxiv.2511.07505,
title = {FedRW: Efficient Privacy-Preserving Data Reweighting for Enhancing Federated Learning of Language Models},
author = {Pukang Ye and Junwei Luo and Xiaolei Dong and Yunbo Yang},
journal= {arXiv preprint arXiv:2511.07505},
year = {2025}
}
备注
Accepted at NeurIPS 2025. Code is available at https://github.com/Hecateto/FedRW