FedSyn:基于联邦学习的合成数据生成
机器学习
2022-04-07 v2 机器学习
摘要
随着深度学习算法持续演进并变得愈发复杂,它们需要海量数据集以进行模型训练并保障模型效能。其中部分数据需求可借助组织内现有数据集得到满足。当前的机器学习实践可被用于从现有数据集生成合成数据。进一步,众所周知,所生成合成数据的多样性依赖于(且或许受限于)单一组织或实体内可用数据集的统计特性。现有数据集越多样,合成数据越具表达力与通用性。然而,鉴于底层数据的稀缺性,在单一组织内整合大数据颇具挑战。不同组织间多样且不重叠的数据集为它们提供了机会,可将各自有限的独特数据贡献至更大池中以供进一步合成。遗憾的是,这引发了某些机构可能不愿接受的数据隐私担忧。本文提出一种生成合成数据的新方法——FedSyn。FedSyn是一种协作式、保护隐私的方法,用于在联邦与协作网络中于多个参与方之间生成合成数据。FedSyn创建一个合成数据生成模型,能够生成包含网络中几乎所有参与方统计分布的合成数据。FedSyn无需访问单个参与方的数据,从而保护参与方数据隐私。本文所提技术利用联邦机器学习与生成对抗网络(GAN)作为合成数据生成的神经网络架构。所提方法可扩展至金融、医疗、治理、科技等诸多机器学习问题类别。
引用
@article{arxiv.2203.05931,
title = {FedSyn: Synthetic Data Generation using Federated Learning},
author = {Monik Raj Behera and Sudhir Upadhyay and Suresh Shetty and Sudha Priyadarshini and Palka Patel and Ker Farn Lee},
journal= {arXiv preprint arXiv:2203.05931},
year = {2022}
}