适配深度生成方法以生成具有真实边缘分布的合成数据
机器学习
2021-05-17 v1 机器学习
摘要
合成数据生成在隐私保护等多种应用中备受关注。深度生成模型,如变分自编码器(VAEs),是从原始数据创建此类合成数据集的流行方法。尽管 VAEs 取得成功,其在双峰与偏态边缘分布方面仍存在局限。这些分布偏离了 VAEs 中潜表示通常所用的正态假设所鼓励的单峰对称分布。虽有假设潜空间其他分布的扩展,但这通常不能增加对具有多种不同分布数据的灵活性。因此,我们提出一种新方法——预变换变分自编码器(PTVAEs),通过对原始变量层面采用预变换来专门处理双峰与偏态数据。使用两类变换,通过对数据集中每个变量分别进行参数优化,使数据接近正态分布。我们将本方法与其它最先进的合成数据生成方法进行性能比较。除可视化比较外,我们使用效用度量进行定量评估。结果表明 PTVAE 方法在双峰与偏态数据生成上均优于其他方法。此外,该方法的简洁性使其可与其他 VAE 扩展结合使用。
引用
@article{arxiv.2105.06907,
title = {Adapting deep generative approaches for getting synthetic data with realistic marginal distributions},
author = {Kiana Farhadyar and Federico Bonofiglio and Daniela Zoeller and Harald Binder},
journal= {arXiv preprint arXiv:2105.06907},
year = {2021}
}