SDV 与 SynthCity 用于合成表格数据生成的开源库比较研究
机器学习
2025-06-24 v1 人工智能
摘要
高质量的训练数据对机器学习模型尤其是大型语言模型(LLMs)的性能至关重要。然而,获取真实且高质量的数据在实际中具有挑战性,尤其是对于较小的组织和早期初创企业。合成数据生成器提供了一条可行的解决方案,通过复制真实数据的统计和结构特性同时保持隐私和可扩展性。本研究评估了六个来自两个广泛使用的开源库(SDV 包括高斯 Copula、CTGAN、TVAE;Synthicity 包括贝叶斯网络、CTGAN、TVAE)的表格合成数据生成器的性能。我们使用来自UCI机器学习存储库的真实数据集,包含来自比利时的数据能源消耗和环境变量。通过在仅1,000行的数据 regimes 下训练模型来模拟低数据情境。随后,每个生成器都在两种条件下被要求产生合成数据集:1:1(1,000行)和1:10(10,000行)的输入输出比。评估标准包括:通过经典统计方法和分布度量衡量的统计相似性;以及使用“在合成数据上训练,在真实数据上测试”方法评估预测实用性,采用四个回归模型。虽然两种情境下的所有模型在统计相似性方面表现一致,但在1:10情况下预测实用性显著下降。Synthicity 的贝叶斯网络在两种情境下均实现了最高的保真度,而SDV 的TVAE 在1:10设置下在预测任务中表现最佳。尽管两个库之间未发现显著的性能差异,但SDV 在文档完整性和易用性方面显著优于Synthicity,使其对实践者更具可访问性。
引用
@article{arxiv.2506.17847,
title = {A Comparative Study of Open-Source Libraries for Synthetic Tabular Data Generation: SDV vs. SynthCity},
author = {Cristian Del Gobbo},
journal= {arXiv preprint arXiv:2506.17847},
year = {2025}
}
备注
23 Pages, 5 figures, and 6 tables