SiloFuse:基于潜在表格扩散模型的跨孤岛合成数据生成
机器学习
2024-04-05 v1 密码学与安全
数据库
分布式、并行与集群计算
摘要
合成表格数据对于跨孤岛共享和扩充数据至关重要,特别是对于拥有专有数据的企业。然而,现有的合成器是为集中存储的数据设计的。因此,它们在特征分布在多个孤岛且需要本地数据存储的真实场景中表现不佳。我们引入了 SiloFuse,这是一个用于从跨孤岛表格数据合成高质量数据的新型生成框架。为了确保隐私,SiloFuse 利用分布式潜在表格扩散架构。通过自编码器,为每个客户端的特征学习潜在表示,从而掩盖其真实值。我们采用堆叠分布式训练来提高通信效率,将轮数减少到单步。在 SiloFuse 下,我们证明了垂直分区合成中数据重建的不可能性,并通过我们的基准框架利用三种攻击量化了隐私风险。在九个数据集上的实验结果展示了 SiloFuse 相对于基于集中式扩散的合成器的能力。值得注意的是,SiloFuse 在相似性和实用性方面比 GAN 分别高出 43.8 和 29.8 个百分点。通信实验表明,随着训练迭代次数的增加,与端到端训练不断增长的成本相比,堆叠训练具有固定成本。此外,SiloFuse 证明了对特征排列和不同客户端数量的鲁棒性。
引用
@article{arxiv.2404.03299,
title = {SiloFuse: Cross-silo Synthetic Data Generation with Latent Tabular Diffusion Models},
author = {Aditya Shankar and Hans Brouwer and Rihan Hai and Lydia Chen},
journal= {arXiv preprint arXiv:2404.03299},
year = {2024}
}
备注
Accepted at 40th IEEE International Conference on Data Engineering (ICDE 2024)