粗粒度种族数据掩盖临床风险评分表现中的差异
计算机与社会
2023-08-28 v2 机器学习
应用统计
摘要
美国的医疗数据通常仅记录患者的粗粒度种族组别:例如,印度裔与中国裔患者通常被编码为“亚裔”。然而,这种粗粒度编码是否掩盖了临床风险评分在细粒度种族组别间表现的显著差异尚属未知。本文表明确实如此。利用来自 418K 次急诊就诊的数据,我们针对三种结局、五种风险评分和四种表现指标,评估了 26 个细粒度组别间的临床风险评分表现差异。在各类结局与指标下,我们显示这些风险评分在粗粒度种族组别内部表现出显著的细粒度表现差异。事实上,粗粒度组别内部的变异常*超过*粗粒度组别之间的变异。我们探究了这些差异的成因,发现结局发生率、特征分布以及特征与结局间的关系在各细粒度组别间均存在显著变化。我们的结果表明,医疗提供者、医院系统与机器学习研究者应努力收集、发布并使用细粒度种族数据以替代粗粒度种族数据,且现有分析可能严重低估了表现中的种族差异。
引用
@article{arxiv.2304.09270,
title = {Coarse race data conceals disparities in clinical risk score performance},
author = {Rajiv Movva and Divya Shanmugam and Kaihua Hou and Priya Pathak and John Guttag and Nikhil Garg and Emma Pierson},
journal= {arXiv preprint arXiv:2304.09270},
year = {2023}
}
备注
Published at MLHC 2023. v2 includes minor changes from the camera-ready, such as a link to code. Code is available at https://github.com/rmovva/granular-race-disparities_MLHC23