Fed-TGAN:用于合成表格数据的联邦学习框架
机器学习
2025-08-12 v2
摘要
生成对抗网络(GAN)通常在训练数据可直接访问的假设下被训练以合成数据,从图像到近来的表格数据。近来,联邦学习(FL)是一种新兴范式,其特点是在客户端本地数据上进行去中心化学习并具备隐私保护能力。尽管在FL系统上学习GAN以合成图像已被证明可行,但用于表格数据的GAN能否从去中心化数据源学习尚属未知。此外,哪种分布式架构最适合它们仍不清楚。与图像GAN不同,最先进的表格GAN需要关于每列(离散与连续)数据分布的先验知识以达成通用编码——这危及隐私保证。本文提出Fed-TGAN,首个面向表格GAN的联邦学习框架。为在非独立同分布的参与者上有效学习复杂表格GAN,Fed-TGAN设计了两项新特性:(i)用于模型初始化的隐私保护多源特征编码;以及(ii)用于聚合本地模型以应对数据偏斜的表相似度感知加权策略。我们在四个广泛使用的数据集上针对多种去中心化学习架构变体对Fed-TGAN进行了充分评估。结果表明,相较于替代架构,Fed-TGAN在IID与非IID数据下将每轮训练时间加速高达200%。总体而言,Fed-TGAN不仅稳定了训练损失,还实现了生成数据与原始数据间更好的相似性。我们的代码发布于 https://github.com/zhao-zilong/Fed-TGAN。
引用
@article{arxiv.2108.07927,
title = {Fed-TGAN: Federated Learning Framework for Synthesizing Tabular Data},
author = {Zilong Zhao and Robert Birke and Aditya Kunar and Lydia Y. Chen},
journal= {arXiv preprint arXiv:2108.07927},
year = {2025}
}