面向差分隐私的资源自适应联邦文本生成
机器学习
2026-03-10 v1
摘要
在跨-silo 联邦学习中,敏感文本数据受隐私法规限制,必须留在本地组织,从而使得为每个下游任务反复训练变得既通信密集又隐私需求高。一个有前景的替代方案是生成差分隐私(DP)合成数据集,这些数据近似全局分布,可跨任务重复使用。然而,预训练的大型语言模型(LLMs)在 domain shift 下往往难以胜任,联邦微调也受计算异构性的制约:只有资源丰富的客户机才能更新模型,而资源较弱的客户机被排除在外,这加剧了数据偏斜并放大了 DP 噪声的不利影响。我们提出一种灵活的参与框架,适应客户机的容量。强客户机执行 DP 联邦微调,而弱客户机通过轻量级 DP 投票机制贡献,以细化生成的文本。为确保合成数据反映全局数据集,我们应用控制代码(如标签、主题、元数据),代表每个客户机的数据比例,并约束投票以语义上连贯的子集为单位。该两阶段方法仅需弱客户机进行一次通信 rounds,并整合来自所有参与者的贡献。实验表明,我们的框架在 DP 和异构性条件下提高了分布对齐度和下游鲁棒性。
引用
@article{arxiv.2603.07027,
title = {Resource-Adaptive Federated Text Generation with Differential Privacy},
author = {Jiayi Wang and John Gounley and Heidi Hanson},
journal= {arXiv preprint arXiv:2603.07027},
year = {2026}
}
备注
Accepted by DATA-FM workshop @ ICLR 2026