POPri:基于偏好优化合成数据的私有联邦学习
机器学习
2025-08-20 v2 人工智能
密码学与安全
分布式、并行与集群计算
摘要
在实际场景中,差分隐私联邦学习(DP-FL)是训练来自私有、设备端客户端数据的模型的主导方法。最近的工作表明,DP-FL可能被增强或被使用DP合成数据的方法所取代(Wu等人,2024;Hou等人,2024)。生成DP合成数据用于FL应用的主要算法需要基于公共信息和/或来自迭代私有客户端反馈的精心设计提示。我们的关键洞察是,先前DP合成数据方法(Hou等人,2024;Xie等人,2024)收集的私有客户端反馈可被视为RL(强化学习)奖励。我们的算法,面向私有数据的策略优化(POPri),利用诸如直接偏好优化(DPO)等策略优化算法来利用客户端反馈微调LLM,以生成高质量的DP合成数据。为评估POPri,我们发布了LargeFedBench,这是一个新的联邦文本基准,针对联邦客户端数据进行不可污染的LLM评估。POPri在LargeFedBench数据集上显著改进了DP合成数据相对于先前工作的实用性,以及来自Xie等人(2024)的现有基准。POPri将在完全私有和非私有设置之间的下一个标记预测准确率差距缩小至最高58%,而相对于之前的合成数据方法为28%,相对于最先进的DP联邦学习方法为3%。代码和数据可在 https://github.com/meiyuw/POPri 查看。
引用
@article{arxiv.2504.16438,
title = {POPri: Private Federated Learning using Preference-Optimized Synthetic Data},
author = {Charlie Hou and Mei-Yu Wang and Yige Zhu and Daniel Lazar and Giulia Fanti},
journal= {arXiv preprint arXiv:2504.16438},
year = {2025}
}
备注
ICML 2025 camera-ready