面向医疗机器学习的个体层预测不稳定性诊断工具
机器学习
2026-04-16 v2 应用统计
机器学习
摘要
在医疗领域,预测模型日益用于患者层面的决策,但对个体风险估计的变异性及其对治疗决策的影响几乎未受关注。对于当下在机器学习中标准化的过参数化模型,变异性的主要来源常常被掩盖。即便数据和模型架构固定,由优化过程和初始化引入的随机性也可能导致同一患者的风险估计出现显著差异。这种问题被标准评估实践所掩盖,这些实践依赖于对个体层稳定性不敏感的聚合性能指标(如对数损失、准确率)。因此,尽管模型在聚合性能上几乎无差异,却可能表现出显著的程序性任意性,这会动摇临床信任。我们提出了评估框架,通过两种互补诊断工具来量化个体层预测不稳定性:经验预测区间宽度 (ePIW),捕捉连续风险估计的变异性;经验决策翻转率 (eDFR),衡量基于阈值的临床决策的不稳定性。我们将这些诊断工具应用于模拟数据和 GUSTO-I 临床数据集。我们发现,对于灵活的机器学习模型,仅由优化和初始化引起的随机性,即可导致个体层变异性的幅度,相当于对整个训练数据集进行抽样所产生的变异性。神经网络在个体风险预测不稳定性方面,显著大于 logistic 回归模型。接近临床相关决策阈值的风险估计不稳定性可能改变治疗建议。我们的发现表明,稳定性诊断应被纳入常规模型验证,以评估临床可靠性。
引用
@article{arxiv.2603.00192,
title = {Diagnostics for Individual-Level Prediction Instability in Machine Learning for Healthcare},
author = {Elizabeth W. Miller and Jeffrey D. Blume},
journal= {arXiv preprint arXiv:2603.00192},
year = {2026}
}