中文

合成数据保险库中的序列模型

机器学习 2022-08-01 v1 数学软件

摘要

本文的目标是描述一个在合成数据保险库(Synthetic Data Vault)中生成合成序列数据的系统。为此,我们提出 SDV 中当前的序列模型,这是一个为多序列真实世界数据构建生成模型的端到端框架。这包括一个新颖的基于神经网络的机器学习模型,即条件概率自回归(CPAR)模型。整个系统与模型可在开源合成数据保险库(SDV)库 {https://github.com/sdv-dev/SDV} 中获取,连同用于不同合成数据需求的各种其他模型。在构建序列 SDV 后,我们使用它生成合成数据,并将其质量与现有的基于非序列生成对抗网络(GAN)的模型 CTGAN 进行比较。为了将序列合成数据与其真实对应数据进行比较,我们发明了一种称为多序列聚合相似度(MSAS)的新度量。我们使用它得出结论:我们的序列 SDV 模型学习了比非序列模型更高层次的模式,且在合成数据质量上无任何折损。

关键词

引用

@article{arxiv.2207.14406,
  title  = {Sequential Models in the Synthetic Data Vault},
  author = {Kevin Zhang and Neha Patki and Kalyan Veeramachaneni},
  journal= {arXiv preprint arXiv:2207.14406},
  year   = {2022}
}

备注

17 pages, 8 figures