中文

临床风险预测中公平机器学习的实证刻画

机器学习 2021-06-16 v3 计算机与社会 机器学习 应用统计

摘要

使用机器学习指导临床决策有可能加剧现有的健康不平等。近期的若干工作将该问题框定为算法公平(algorithmic fairness)问题,这一框架已引起相当关注与批评。然而,由于伦理与技术两方面的考量,该框架是否恰当尚不清楚;后者包括对于临床结局预测模型而言尚未被充分理解的公平度量与模型性能之间的权衡。为给持续进行的辩论提供信息,我们开展了一项实证研究,以刻画惩罚群体公平违例对一系列模型性能与群体公平度量的影响。我们在多个观察性医疗数据库、临床结局和敏感属性上重复了分析。我们发现,惩罚群体间预测分布差异的方法在群体内几乎普遍导致多种性能指标的退化。在考察这些方法的次级影响时,我们观察到在不同实验条件下这些方法对校准与排序公平度量的影响存在异质性。除所报告的权衡外,我们强调医疗中的算法公平分析缺乏必要的语境基础与因果意识,以推理导致健康不平等的机制,以及算法公平方法抵消这些机制的潜力。鉴于这些局限,我们鼓励构建临床预测模型的研者跳出算法公平框架,批判性地参与围绕医疗中机器学习应用的更广泛社会技术语境。

关键词

引用

@article{arxiv.2007.10306,
  title  = {An Empirical Characterization of Fair Machine Learning For Clinical Risk Prediction},
  author = {Stephen R. Pfohl and Agata Foryciarz and Nigam H. Shah},
  journal= {arXiv preprint arXiv:2007.10306},
  year   = {2021}
}

备注

Published in the Journal of Biomedical Informatics (https://doi.org/10.1016/j.jbi.2020.103621). Version 3 updates acknowledgements and fixes typos