MedEqualizer:探索合成医疗数据偏差及通过增强缓解的框架
机器学习
2025-11-04 v1
摘要
合成医疗数据生成是一种可行的方法,用于提高数据可访问性并支持研究,克服了现实医疗数据集的局限性。然而,确保合成数据在受保护属性上的公平性至关重要,以避免临床研究和决策中的偏见或误导。本研究使用基于生成对抗网络 (GAN) 的多个生成模型生成的合成数据,我们重点关注其在受保护人口统计属性上的代表性。我们使用对数差异度量衡量子群代表性,发现许多子群在合成数据中相对于真实数据的代表性存在显著不平衡——有的未被充分代表,有的被过度代表。为缓解这些差异,我们引入 MedEqualizer,一个模型无关的增强框架,在合成数据生成前丰富未被充分代表的子群。我们的结果表明,MedEqualizer 显著改善了合成数据集中人口统计特征的平衡,为实现更公平和更具代表性的医疗数据合成提供了可行路径。
引用
@article{arxiv.2511.01054,
title = {MedEqualizer: A Framework Investigating Bias in Synthetic Medical Data and Mitigation via Augmentation},
author = {Sama Salarian and Yue Zhang and Swati Padhee and Srinivasan Parthasarathy},
journal= {arXiv preprint arXiv:2511.01054},
year = {2025}
}