中文

面向任意下游预测任务的公平性优化合成电子健康记录生成

机器学习 2025-06-30 v3

摘要

在确保医疗保健应用AI工具负责任设计的各个方面中,解决公平性问题一直是一个关键焦点。具体来说,鉴于电子健康记录(EHR)数据的广泛普及及其在支持各种临床决策任务方面的巨大潜力,提高这类健康AI工具的公平性至关重要。虽然这个广泛的问题(缓解基于EHR的AI模型中的公平性)已经通过各种方法解决,但任务和模型无关的方法明显罕见。在本研究中,我们旨在通过提出一个新的流水线来填补这一空白,该流水线生成合成EHR数据,这些数据不仅与真实EHR数据一致(忠实),而且在与真实数据结合时,可以减少下游任务中的公平性问题(由最终用户定义)。我们展示了所提出的流水线在各种下游任务和两个不同EHR数据集上的有效性。我们的流水线可以为现有的解决健康AI应用公平性的方法工具箱(例如那些修改下游模型设计的方法)添加一个广泛适用且互补的工具。我们的项目代码库可在https://github.com/healthylaife/FairSynth获取。

关键词

引用

@article{arxiv.2406.02510,
  title  = {Fairness-Optimized Synthetic EHR Generation for Arbitrary Downstream Predictive Tasks},
  author = {Mirza Farhan Bin Tarek and Raphael Poulain and Rahmatollah Beheshti},
  journal= {arXiv preprint arXiv:2406.02510},
  year   = {2025}
}

备注

The paper has been accepted at the IEEE/ACM conference on Connected Health: Applications, Systems and Engineering Technologies (CHASE) 2025