中文

合成表格数据验证:一种基于发生器的方法

机器学习 2024-08-01 v2 人工智能

摘要

各领域日益广泛使用生成模型,其中表格数据应用广泛,这凸显了对评估真实数据与合成数据相似性的稳健且标准化的验证指标的需求。当前方法缺乏统一的框架,依赖多样且常常令人难以理解的统计测量。发生器用于量化数据分布之间差异,为验证之所以提供了有前景的途径。然而,传统方法因难以建模联合分布而为每个特征独立计算发生器。本文通过提出一种新方法,使用发生器估计来克服边缘比较的局限性。我们的核心贡献在于将发生器估计器应用于构建考虑真实数据与合成数据联合分布的验证指标。我们利用概率分类器来近似数据集之间的密度比,从而捕获复杂关系。我们特别计算两种发生器:众所周知的 Kullback-Leibler (KL) 发生器和 Jensen-Shannon (JS) 发生器。KL 发生器在该领域中已有 established 的应用,而 JS 发生器是对称且有界的,提供可靠的指标。通过一系列实验演示了该方法的有效性,其中包括对简单分布的估计发生器与分析解之间的比较,以建立准确性基准。最后,我们在真实数据集及其对应的合成数据集上验证了该方法,展示了其在实际应用中的有效性。该研究为表格数据之外的领域提供了重要贡献,并有潜力提高合成数据验证在各领域中的效果。

关键词

引用

@article{arxiv.2405.07822,
  title  = {Synthetic Tabular Data Validation: A Divergence-Based Approach},
  author = {Patricia A. Apellániz and Ana Jiménez and Borja Arroyo Galende and Juan Parras and Santiago Zazo},
  journal= {arXiv preprint arXiv:2405.07822},
  year   = {2024}
}

备注

15 pages, 14 figures