MMM 与 MMMSynth:异构表格数据的聚类及合成数据生成
机器学习
2024-04-22 v2 机器学习
摘要
我们针对异构表格数据集相关的两项任务——聚类和合成数据生成——提出了新算法。表格数据集通常由各列中的异构数据类型(数值型、有序型、分类型)组成,但其行中也可能存在隐藏的簇结构:例如,它们可能来自异构(地理、社会经济、方法学)来源,从而使得它们所描述的结果变量(如疾病是否存在)不仅依赖于其他变量,还依赖于簇上下文。此外,生物医学数据的共享常受患者保密法规阻碍,当前业界对从真实数据生成合成表格数据的算法(例如通过深度学习)颇有兴趣。我们展示了一种新颖的基于 EM 的聚类算法 MMM(“Madras 混合模型”),其在确定合成异构数据中的簇方面优于标准算法,并能恢复真实数据中的结构。在此基础上,我们展示了一种合成表格数据生成算法 MMMsynth,该算法对输入数据进行预聚类,并假设输入列具有簇特定的数据分布,从而逐簇生成合成数据。我们通过测试标准机器学习(ML)算法在合成数据上训练并在真实已发布数据集上测试的性能,对该算法进行了基准评估。我们的合成数据生成算法优于文献中其他表格数据生成器,并接近仅使用真实数据训练的性能。
引用
@article{arxiv.2310.19454,
title = {MMM and MMMSynth: Clustering of heterogeneous tabular data, and synthetic data generation},
author = {Chandrani Kumari and Rahul Siddharthan},
journal= {arXiv preprint arXiv:2310.19454},
year = {2024}
}
备注
17 pages, 5 figures