中文

合成关系型数据的保真性与效用的基准测试

数据库 2024-10-07 v1 机器学习

摘要

合成关系型数据已开始受到研究者、实践者和行业的关注。由于涉及表之间关系的复杂性,这一任务比仅合成单个数据表更具挑战性。为此,合成关系型数据的基准测试方法也引入了新的挑战。我们的工作由缺乏对最先进方法的实证评估以及对应如何进行评估存在认知缺失所驱动。我们审阅了关系型数据合成的相关工作、常见基准数据集,以及衡量合成数据保真性和效用的方法。我们将最佳实践与一种新型稳健检测方法结合,构建为基准测试工具,并用于比较六种方法,包括两款商业工具。尽管某些方法优于其他方法,但没有任何方法能够合成与原始数据 indistinguishable 的数据集。对于效用,我们通常观察到真实数据与合成数据在模型预测性能和特征重要性方面的相关性属于中等水平。

关键词

引用

@article{arxiv.2410.03411,
  title  = {Benchmarking the Fidelity and Utility of Synthetic Relational Data},
  author = {Valter Hudovernik and Martin Jurkovič and Erik Štrumbelj},
  journal= {arXiv preprint arXiv:2410.03411},
  year   = {2024}
}