MCRAGE:用于公平性的合成医疗数据
摘要
在医疗领域,电子健康记录(EHR)是开发用于诊断、治疗及医疗资源管理的机器学习模型的关键训练数据。然而,医疗数据集常在与种族/民族、性别和年龄等敏感属性相关的类别上不平衡。在类别不平衡的 EHR 数据集上训练的机器学习模型,在部署时对少数类个体的表现明显劣于多数类个体,可能导致少数群体获得不公平的医疗结果。为应对该挑战,我们提出少数类通过生成模型增强的再平衡方法(MCRAGE),一种利用深度生成模型生成的样本来增强不平衡数据集的新方法。MCRAGE 过程包括训练一个条件去噪扩散概率模型(CDDPM),其能从未充分代表的类别生成高质量合成 EHR 样本。我们用这些合成数据增强现有不平衡数据集,从而得到所有类别更均衡的分布,可用于训练偏差更小的下游模型。我们使用这些下游模型的准确率、F1 分数和 AUROC 来衡量 MCRAGE 相对于替代方法的性能。我们基于近期 DDPM 的收敛结果为方法提供理论依据。
引用
@article{arxiv.2310.18430,
title = {MCRAGE: Synthetic Healthcare Data for Fairness},
author = {Keira Behal and Jiayi Chen and Caleb Fikes and Sophia Xiao},
journal= {arXiv preprint arXiv:2310.18430},
year = {2024}
}
备注
Keywords: synthetic electronic health records, conditional denoising diffusion probabilistic model, healthcare AI, tabular data, fairness, synthetic data. This paper is the result of work completed at the 2023 Emory University Department of Mathematics REU/RET program under the direction of Project Advisor Dr. Xi Yuanzhe. This work is sponsored by NSF DMS 2051019