中文

可调相关性保留:一种生成合成数据的统计方法

机器学习 2025-06-25 v3 概率论 数据分析、统计与概率

摘要

我们提出了一种从给定数据集生成具有统计代表性的合成数据的方法。该方法的主要目标是使创建的数据集模拟原始数据中存在的特征间相关性,同时提供一个可调参数来影响隐私水平。具体而言,我们的方法通过使用原始数据集特征之间的经验条件分布来构建统计映射。部分可调性是通过限制所使用的条件分布的深度来实现的。我们详细描述了用于构建统计映射以及如何使用该映射生成合成观测值的算法。该方法通过三种不同方式进行了测试:手工计算示例;制造的数据集;以及马德拉岛家庭消耗/生产的真实世界能源相关数据集。我们通过在不同分辨率级别和相关性深度下使用 Pearson 相关性矩阵比较数据集来评估该方法。这两个考量因素被视为影响生成数据集保真度和隐私度的可调参数。所提出的方法具有通用性,即它不依赖于所使用的测试数据集。我们期望它能在比本文所述更广泛的背景中适用。

关键词

引用

@article{arxiv.2403.01471,
  title  = {Tunable correlation retention: A statistical method for generating synthetic data},
  author = {Nicklas Jävergård and Rainey Lyons and Adrian Muntean and Jonas Forsman},
  journal= {arXiv preprint arXiv:2403.01471},
  year   = {2025}
}