中文

面向表格数据生成的条件GAN:基于概率抽样的潜在子空间

机器学习 2025-08-04 v1

摘要

表格形式是关系数据库系统和电子表格中数据表示的标准方式。但像其他形式一样,表格数据也受类不平衡问题的影响,这在广泛的机器学习任务中会导致严重的性能下降。最有效的解决方案是使用生成对抗网络(GAN)合成代表性不足的类的人工数据实例。尽管这些方法表现良好,但目前提出的GAN模型都未考虑输入样本在真实数据空间中的向量子空间,导致数据在任意位置生成。此外,类别标签在训练时被 Treatment 与其他分类变量相同,使得条件抽样 by class 变得不够有效。为克服这些问题,本研究提出了ctdGAN,这是一个用于缓解表格数据集类不平衡的条件GAN。首先,ctdGAN执行空间分区步骤为输入样本分配聚类标签。随后,它利用这些标签通过一种新颖的概率抽样策略和一个惩罚同时惩罚聚类和类别误预测的新损失函数来合成样本。如此一来,ctdGAN在训练时被设计在类似原始数据分布的子空间中生成样本。我们还引入了几项其他改进,包括一种简单而有效的聚类级比例缩放技术,该技术在不影响数据维度的情况下捕获多个特征模式。对ctdGAN进行详尽评估,使用14个不平衡数据集显示其在生成高保真样本和提高分类准确率方面具有优势。

关键词

引用

@article{arxiv.2508.00472,
  title  = {A Conditional GAN for Tabular Data Generation with Probabilistic Sampling of Latent Subspaces},
  author = {Leonidas Akritidis and Panayiotis Bozanis},
  journal= {arXiv preprint arXiv:2508.00472},
  year   = {2025}
}