合成医疗数据在下游公平性上的隐患
机器学习
2022-03-10 v1
摘要
本文评估了合成生成的医疗数据中的偏差,并研究了公平性缓解技术对效用-公平性的影响。隐私法律限制了对电子病历(EMRs)等健康数据的访问以保护患者隐私。尽管这些法律必不可少,但它们阻碍了研究的可复现性。合成数据是一种可行的解决方案,能够在无隐私风险的情况下提供类似于真实医疗数据的访问。医疗数据集可能存在某些受保护群体比其他群体遭遇更差结果的偏差。由于真实数据存在偏差,合成生成的健康数据的公平性便值得质疑。在本文中,我们评估了在两个医疗数据集上生成的模型在性别与种族偏差方面的公平性。我们使用称为 HealthGAN 的生成对抗网络(GAN)生成该数据集的合成版本,并比较真实与合成模型的平衡准确率和公平性分数。我们发现合成数据与真实数据具有不同的公平性属性,且公平性缓解技术表现不同,这凸显了合成数据并非无偏差。
引用
@article{arxiv.2203.04462,
title = {Downstream Fairness Caveats with Synthetic Healthcare Data},
author = {Karan Bhanot and Ioana Baldini and Dennis Wei and Jiaming Zeng and Kristin P. Bennett},
journal= {arXiv preprint arXiv:2203.04462},
year = {2022}
}