非独立同分布数据上的联邦表格数据增强
机器学习
2023-01-13 v2 密码学与安全
机器学习
摘要
非独立同分布(non-IID)数据是联邦学习(FL)中的一个关键挑战,通常会妨碍 FL 的优化收敛与性能。现有基于联邦生成模型或原始数据共享策略以解决 non-IID 问题的数据增强方法,在去中心化表格数据中仍面临性能低、隐私保护担忧和通信开销高的问题。为应对这些挑战,我们提出一种联邦表格数据增强方法,名为 Fed-TDA。Fed-TDA 的核心思想是利用一些简单统计量(例如每列的分布与全局协方差)来合成表格数据以进行数据增强。具体而言,我们提出多模态分布变换与逆累积分布映射,分别依据预学习统计量从噪声中合成表格数据中的连续列与离散列。此外,我们从理论上分析出我们的 Fed-TDA 不仅保护数据隐私,还保持原始数据的分布及列间相关性。通过在五个真实世界表格数据集上的大量实验,我们证明了 Fed-TDA 在测试性能与通信效率上优于当前最优方法。
引用
@article{arxiv.2211.13116,
title = {Fed-TDA: Federated Tabular Data Augmentation on Non-IID Data},
author = {Shaoming Duan and Chuanyi Liu and Peiyi Han and Tianyu He and Yifeng Xu and Qiyuan Deng},
journal= {arXiv preprint arXiv:2211.13116},
year = {2023}
}