基于强化学习的因果感知生成对抗网络
机器学习
2025-10-29 v1 人工智能
摘要
表格数据的实用性常受限于隐私顾虑或监管障碍。虽然基于生成对抗网络 (GAN) 的现有数据生成方法显示出前景,但它们常在捕获复杂因果关系、保持数据实用性以及提供适用于企业部署的可证明隐私保证方面受限。我们引入 CA-GAN,一种专为实际表格数据集设计的新型生成框架,以解决这些挑战。CA-GAN 采用两阶段方法:首先通过因果图提取学习数据流形中的稳健、全面的因果关系;其次使用自定义条件 WGAN-GP(Wasserstein GAN with Gradient Penalty)根据因果图中节点的结构进行操作。更重要的是,生成器通过一种新的基于强化学习的目标函数训练,以确保来自真实数据和假数据的因果图相互吻合,从而在训练和抽样阶段实现因果感知。我们在 14 个表格数据集上证明了 CA-GAN 超越 6 种 SOTA 方法的优势。我们的评估聚焦于核心数据工程指标:因果保持、实用性保持和隐私保持。该方法为数据工程师提供了一种实用、高性能的解决方案,用于创建高质量、符合隐私要求的合成数据集,以用于数据库系统基准测试、加速软件开发和促进安全数据驱动研究。
引用
@article{arxiv.2510.24046,
title = {Causal-Aware Generative Adversarial Networks with Reinforcement Learning},
author = {Tu Anh Hoang Nguyen and Dang Nguyen and Tri-Nhan Vo and Thuc Duy Le and Sunil Gupta},
journal= {arXiv preprint arXiv:2510.24046},
year = {2025}
}