缓解健康数据匮乏:生成式方法与时序临床数据重采样的比较
机器学习
2022-10-27 v2 计算机与社会
机器学习
摘要
已开发多种方法来缓解源于健康数据匮乏的算法偏差,即少数群体在训练数据集中代表性不足。使用重采样(如 SMOTE)扩充少数类因其算法简单而被广泛使用。然而,这些算法降低了数据变异性并可能引入样本间相关性,从而催生了基于 GAN 的生成式方法。生成提供真实数据广泛分布覆盖的高维、时间序列、真实数据,对重采样和基于 GAN 的方法而言仍是一项挑战性任务。在这项工作中,我们提出 CA-GAN 架构以解决当前方法的一些缺陷,并使用一个包含 3343 名低血压高加索人和黑人的高维、时间序列真实数据集,与 SMOTE 和 WGAN-GP* 进行了详细比较。我们表明,我们的方法在生成少数类的真实数据以及保持在真实数据原始分布内两方面均更优。
引用
@article{arxiv.2210.13958,
title = {Mitigating Health Data Poverty: Generative Approaches versus Resampling for Time-series Clinical Data},
author = {Raffaele Marchesi and Nicolo Micheletti and Giuseppe Jurman and Venet Osmani},
journal= {arXiv preprint arXiv:2210.13958},
year = {2022}
}
备注
Accepted at NeurIPS 2022 Workshop on Synthetic Data for Empowering ML Research (Neurips 2022 SyntheticData4ML)