在合成表格数据中保留逻辑依赖与函数依赖
机器学习
2024-09-27 v1 人工智能
摘要
属性间的依赖关系是表格数据的一个常见方面。然而,现有的表格数据生成算法在生成合成数据时是否保留了这些依赖关系,仍有待探索。除了现有的函数依赖概念,本文还引入了属性间逻辑依赖的概念。此外,我们提供了一种度量方法来量化表格数据中属性间的逻辑依赖。利用这一度量,我们比较了几种最先进的合成数据生成算法,并测试了它们在几个公开数据集上保留逻辑依赖和函数依赖的能力。我们证明,当前可用的合成表格数据生成算法在生成合成数据集时,并未完全保留函数依赖。此外,我们还发现,一些表格合成数据生成模型能够保留属性间的逻辑依赖。我们对最先进技术的回顾和比较揭示了开发特定任务合成表格数据生成模型的研究需求与机遇。
引用
@article{arxiv.2409.17684,
title = {Preserving logical and functional dependencies in synthetic tabular data},
author = {Chaithra Umesh and Kristian Schultz and Manjunath Mahendra and Saparshi Bej and Olaf Wolkenhauer},
journal= {arXiv preprint arXiv:2409.17684},
year = {2024}
}
备注
Submitted to Pattern Recognition Journal