M$^3$Fair:通过多层次多敏感属性重加权方法缓解医疗数据中的偏差
机器学习
2023-06-08 v1 人工智能
摘要
在数据驱动的人工智能范式中,模型严重依赖大量训练数据。然而,采样分布不平衡等因素会导致医疗数据中出现偏差与不公平问题。敏感属性,如种族、性别、年龄和医疗状况,是个体常与歧视或偏差相关联的特征。在医疗 AI 中,这些属性在决定个体所接受护理质量方面起着重要作用。例如,在美国,少数群体通常比白人接受更少的治疗程序和更差质量的医疗护理。因此,检测并缓解数据中的偏差对于增进健康公平至关重要。偏差缓解方法包括预处理、处理中和后处理。其中,重加权(RW)是一种被广泛使用的预处理方法,在平衡机器学习性能与公平性表现方面表现良好。RW 调整每个(组,标签)组合内样本的权重,这些权重被用于损失函数。然而,RW 在缓解偏差时仅限于考虑单一敏感属性,并假设每个敏感属性同等重要。这可能在处理交叉性偏差时导致潜在的不准确。为应对这些局限,我们提出 M3Fair,一种通过将 RW 方法扩展到多层次上多个敏感属性的多层次多敏感属性重加权方法。我们在真实世界数据集上的实验表明,该方法在解决医疗公平问题方面有效、简便且可泛化。
引用
@article{arxiv.2306.04118,
title = {M$^3$Fair: Mitigating Bias in Healthcare Data through Multi-Level and Multi-Sensitive-Attribute Reweighting Method},
author = {Yinghao Zhu and Jingkun An and Enshen Zhou and Lu An and Junyi Gao and Hao Li and Haoran Feng and Bo Hou and Wen Tang and Chengwei Pan and Liantao Ma},
journal= {arXiv preprint arXiv:2306.04118},
year = {2023}
}
备注
4 pages, 1 table, Beijing Health Data Science Summit 2023