SYNC:一种基于Copula的聚合源合成数据生成框架
应用统计
2020-09-22 v1 数据库
机器学习
机器学习
摘要
合成数据集是以程序化方式生成的数据对象,当直接收集数据困难或成本高昂时,从多个来源创建单一数据集可能很有价值。尽管这是许多数据科学任务的基础步骤,但目前缺乏高效且标准的框架。本文研究一种特定的合成数据生成任务——降尺度(downscaling),即从多个低分辨率、易收集的来源推断高分辨率、难收集的信息(例如个体级记录),并提出一个名为SYNC(基于高斯Copula的合成数据生成,Synthetic Data Generation via Gaussian Copula)的多阶段框架。对于给定的低分辨率数据集,SYNC的核心思想是对每个低分辨率数据集拟合高斯Copula模型,以正确捕捉依赖关系和边际分布,然后从拟合模型中采样以获得所需的高分辨率子集。随后使用预测模型将采样子集合并为一个,最后根据低分辨率边际约束对采样数据集进行缩放。我们在本工作中做出四项关键贡献:1)通过结合最先进的机器学习和统计技术,提出一种从聚合数据源生成个体级数据的新框架;2)进行模拟研究以验证SYNC作为合成数据生成算法的性能;3)通过两个真实世界数据集展示其作为特征工程工具的价值,以及在收集困难情况下作为数据收集替代方案的价值;4)发布易于使用的框架实现,以在生产级别实现可复现性和可扩展性,并能轻松整合新数据。
引用
@article{arxiv.2009.09471,
title = {SYNC: A Copula based Framework for Generating Synthetic Data from Aggregated Sources},
author = {Zheng Li and Yue Zhao and Jialin Fu},
journal= {arXiv preprint arXiv:2009.09471},
year = {2020}
}
备注
Proceedings of the 2020 IEEE International Conference on Data Mining Workshops (ICDMW)