利用合成数据缓解不公平并保护隐私:面向协作机器学习
机器学习
2025-01-24 v2 计算机与社会
最优化与控制
摘要
在分布式计算环境中,协作机器学习使多个客户端能够协同训练全局模型。为了保护隐私,常见做法是利用频繁更新和传输模型参数,但这会导致客户端与服务器之间的高通信成本。为解决分布式环境中的不公平问题,必须将客户端特定信息(如本地数据集大小或数据相关的公平性指标)发送给服务器以计算算法量(如聚合权重),这可能导致客户端信息泄露。为此,我们提出了两阶段策略,旨在促进公平预测、防止客户端数据泄露、在某些情况下降低通信成本,而无需在客户端和服务器之间进行迭代传递信息。在第一阶段,对于每个客户端,我们使用其本地数据集获取合成数据集,通过求解双层优化问题来确保最终的全局模型具有公平预测。在第二阶段,我们对第一阶段得到的合成数据集应用具有差分隐私保障的方法,以获得第二阶段的合成数据。我们随后将每个客户端的第二阶段合成数据集传递给服务器,该数据集合用于采用常规机器学习技术进行服务器模型训练(无需考虑公平性指标或隐私问题)。因此,我们消除了处理与公平性相关的聚合权重的需求,同时保持了客户端隐私。我们的方案只需要一次客户端与服务器之间的通信(因此具有较低的通信成本),保持数据隐私,同时促进公平性。我们提供了实证证据来说明该方法的优势。
引用
@article{arxiv.2409.09532,
title = {Using Synthetic Data to Mitigate Unfairness and Preserve Privacy in Collaborative Machine Learning},
author = {Chia-Yuan Wu and Frank E. Curtis and Daniel P. Robinson},
journal= {arXiv preprint arXiv:2409.09532},
year = {2025}
}