中文

基于凸空间的表格合成数据生成

机器学习 2025-02-21 v2

摘要

从少数类凸空间生成合成样本是处理不平衡分类问题的流行过采样方法。最近,深度学习方法已成功应用于建模少数样本的凸空间。超越过采样,学习训练数据中邻域的凸空间以生成整个表格数据集的研究尚未有所探索。本文引入了一种深度学习架构(NextConvGeN),包含生成器和判别器组成部分,能够通过学习表格数据的凸空间来生成合成样本。生成器以数据邻域为输入,在该邻域的凸空间内创建合成样本。随后,判别器尝试将这些合成样本与从数据空间其余部分随机抽取的批次进行分类。我们在来自生物医学领域的十个公开数据集上,将所提模型与五种最先进的表格生成模型进行比较。我们的分析表明,NextConvGeN 生成的合成样本在真实数据和合成数据上的分类性能和聚类性能优于其他合成数据生成模型。凸空间深度学习生成的合成数据在流行实用性指标上得分很高。我们进一步比较了不同合成数据生成策略在隐私-实用性谱系上的表现,对高实用性模型的必要性提出了重要论点。本文关于表格数据凸空间深度学习的研究为临床研究、机器学习模型开发、决策支持系统以及临床数据共享开辟了新的机遇。

关键词

引用

@article{arxiv.2407.09789,
  title  = {Convex space learning for tabular synthetic data generation},
  author = {Manjunath Mahendra and Chaithra Umesh and Saptarshi Bej and Kristian Schultz and Olaf Wolkenhauer},
  journal= {arXiv preprint arXiv:2407.09789},
  year   = {2025}
}

备注

30 pages, 10 figures, submitted to Neurocomputing journal