差异审查与检测不足:临床机器学习中标签偏差的一个来源
机器学习
2022-08-03 v1 计算机与社会
摘要
随着机器学习(ML)模型在临床应用中日益受到关注,理解临床医生和社会偏见对 ML 模型的影响变得愈发重要。尽管模型训练所用标签中可能产生偏见,但这些偏见产生的诸多来源尚未得到充分研究。在本文中,我们强调差异审查(即不同患者群体间检测率的差异)是临床 ML 模型可能放大的标签偏差来源,并可能造成伤害。许多患者风险分层模型是使用临床医生开具的诊断和实验室检测结果的标签进行训练的。没有检测结果的患者通常被赋予负标签,这假定未检测的患者未发生该结局。由于医嘱受临床和资源因素考量影响,检测在患者人群中可能并不均匀,从而产生了差异审查。在风险相当的患者中,差异审查导致某些群体检测不足,进而使这些群体获得更具偏差的标签。在标准 ML 流程中使用此类偏差标签可能加剧不同患者群体间模型性能的差距。在此,我们从理论和实证两方面刻画了差异审查或检测不足影响子群体模型性能的条件。我们的发现提请人们关注差异审查作为临床 ML 模型中标签偏差来源的问题。
引用
@article{arxiv.2208.01127,
title = {Disparate Censorship & Undertesting: A Source of Label Bias in Clinical Machine Learning},
author = {Trenton Chang and Michael W. Sjoding and Jenna Wiens},
journal= {arXiv preprint arXiv:2208.01127},
year = {2022}
}
备注
48 pages, 18 figures. Machine Learning for Healthcare Conference (MLHC 2022)