FedTabDiff:面向合成混合类型表格数据生成的扩散概率模型联邦学习
机器学习
2024-01-15 v1
摘要
逼真的合成表格数据生成在保护隐私方面面临重大挑战,尤其是在处理金融和医疗等领域的敏感信息时。本文提出了联邦表格扩散(FedTabDiff)方法,用于生成高保真混合类型表格数据,而无需集中访问原始表格数据集。利用去噪扩散概率模型(DDPM)的优势,我们的方法解决了表格数据中的固有复杂性,例如混合属性类型和隐含关系。更为关键的是,FedTabDiff 实现了一种去中心化的学习方案,允许多个实体在尊重数据隐私和本地性的前提下协作训练生成模型。我们将 DDPM 扩展到用于表格数据生成的联邦设置中,其中包括同步更新方案和用于有效模型聚合的加权平均。在真实金融和医疗数据集上的实验评估证明了该框架能够生成保持高保真度、实用性、隐私性和覆盖率的合成数据。
引用
@article{arxiv.2401.06263,
title = {FedTabDiff: Federated Learning of Diffusion Probabilistic Models for Synthetic Mixed-Type Tabular Data Generation},
author = {Timur Sattarov and Marco Schreyer and Damian Borth},
journal= {arXiv preprint arXiv:2401.06263},
year = {2024}
}
备注
9 pages, 2 figures, 2 tables, preprint version, currently under review