存在标签选择时避免有偏的临床机器学习模型性能估计
机器学习
2022-09-20 v1
摘要
在评估临床机器学习模型性能时,必须考虑部署人群。当具有观测标签的患者人群仅是部署人群的一个子集(标签选择)时,在观测人群上的标准模型性能估计可能产生误导。本研究中我们描述了三类标签选择,并模拟了五种因果不同的情景,以评估特定选择机制如何使一组常用报告的二分类机器学习模型性能指标产生偏倚。模拟揭示,当选择受观测特征影响时,模型判别力的朴素估计可能误导;当选择受标签影响时,校准度的朴素估计无法反映现实。我们借鉴因果推断文献中的传统加权估计量,发现当选择概率被正确设定时,它们能恢复全人群估计。随后我们处理真实任务:监测已部署机器学习模型的性能,其与临床医生的互动产生反馈并影响标签的选择机制。我们训练了三个机器学习模型以标记低收益实验室诊断,并模拟其减少浪费性实验室使用的预期后果。我们发现观测人群上 AUROC 的朴素估计低估实际性能达 20%。此种差异可能足以导致成功临床决策支持工具被错误终止。我们提出了一种改进的部署流程,将注入随机化与传统加权估计结合,发现其能恢复真实模型性能。
引用
@article{arxiv.2209.09188,
title = {Avoiding Biased Clinical Machine Learning Model Performance Estimates in the Presence of Label Selection},
author = {Conor K. Corbin and Michael Baiocchi and Jonathan H. Chen},
journal= {arXiv preprint arXiv:2209.09188},
year = {2022}
}