概率因果图作为分类数据合成器:它们比高斯 Copula 和条件 Tabular GAN 更好吗?
人工智能
2025-04-17 v1
摘要
本研究探讨了使用因果图模型生成高质量合成分类数据的方法,如调查数据。生成合成数据不仅旨在为模型训练创建多样化数据,还要在捕捉数据之间关系的同时保持隐私。研究采用结构方程模型(SEM) followed by 贝叶斯网络(BN)。我们使用基于可访问性调查数据(针对残障人士)的分类数据。我们创建了 SEM 和 BN 模型来表示因果关系,并捕捉变量之间的联合分布。在本案例研究中,变量包括人口统计信息、残障类型、可访问性障碍类型以及遇到这些障碍的频率。本研究将 SEM 基于 BN 的方法与替代方法进行比较,包括概率高斯 Copula 技巧和生成模型如条件 Tabular 生成式对抗网络(CTGAN)。在统计指标方面,包括卡方检验、Kullback-Leibler 发散和总变差距离(TVD),所提出的方法表现优于其他方法。特别是,BN 模型表现最佳,实现了最高的 TVD,表明其与原始数据高度一致。高斯 Copula排名第二,而 CTGAN 表现适中。这些分析确认了 SEM 基于 BN 能够产生保持统计和关系有效性的合成数据,同时保持保密性。这种方法特别适用于可及性和残障研究等敏感数据的研究。
引用
@article{arxiv.2504.11547,
title = {Probabilistic causal graphs as categorical data synthesizers: Do they do better than Gaussian Copulas and Conditional Tabular GANs?},
author = {Olha Shaposhnyk and Noor Abid and Mouri Zakir and Svetlana Yanushkevich},
journal= {arXiv preprint arXiv:2504.11547},
year = {2025}
}