中文

考虑依赖关系的合成表格数据生成

机器学习 2025-07-28 v1

摘要

合成表格数据越来越多地用于医疗保健等隐私敏感领域,但现有的生成模型通常无法保留属性间的关系。特别是,功能依赖和逻辑依赖——它们捕捉特征之间的确定性和基于规则的关联——在合成数据集中很少被保留或保留得很差。为填补这一研究空白,我们提出了用于合成表格数据生成的分层特征生成框架。我们创建了具有已知依赖关系的基准数据集来评估我们提出的HFGF。该框架首先使用任何标准生成模型生成独立特征,然后基于预定义的FD和LD规则重建依赖特征。我们在四个具有不同规模、特征不平衡性和依赖复杂度的基准数据集上的实验表明,HFGF在六种生成模型(包括CTGAN、TVAE和GReaT)中改善了FD和LD的保留。我们的研究结果表明,HFGF可以显著增强合成表格数据的结构保真度和下游实用性。

关键词

引用

@article{arxiv.2507.19211,
  title  = {Dependency-aware synthetic tabular data generation},
  author = {Chaithra Umesh and Kristian Schultz and Manjunath Mahendra and Saptarshi Bej and Olaf Wolkenhauer},
  journal= {arXiv preprint arXiv:2507.19211},
  year   = {2025}
}

备注

23 pages, 3 figures, submitted to Pattern Recognition