多模态临床病情分类中的校准性与选择性预测的实证分析
机器学习
2026-05-25 v4
摘要
随着人工智能系统向临床部署迈进,确保可靠的预测行为是面向安全关键决策任务的基本要求。一种可行的保障措施是选择性预测(selective prediction),即模型可将不确定的预测 defer 给人类专家进行审查。本文对基于多模态 ICU 数据的多标签临床病情分类中基于不确定性的选择性预测可靠性进行了实证评估。我们在多种最先进的单模态和多模态模型上进行实验,发现尽管标准评估指标表现良好,选择性预测却会显著降低性能。这一失败是由于严重的类别相关误校准(class-dependent miscalibration)所致,即模型对正确预测赋予高不确定性,对错误预测赋予低不确定性,尤其在 underrepresented 临床病情下更为明显。我们的结果表明,常用聚合指标会掩盖这些效应,限制了其在此情境下评估选择性预测行为的能力。综上所述,我们的发现刻画了选择性预测在多模态临床病情分类中出现的任务特定的失效模式,并突显了在临床人工智能中需要校准感知的评估才能提供强有力的安全性和鲁棒性保证。
引用
@article{arxiv.2603.02719,
title = {An Empirical Analysis of Calibration and Selective Prediction in Multimodal Clinical Condition Classification},
author = {L. Julián Lechuga López and Farah E. Shamout and Tim G. J. Rudner},
journal= {arXiv preprint arXiv:2603.02719},
year = {2026}
}
备注
40 pages, 14 figures, 16 tables. Accepted as a conference paper at AHLI Conference on Health, Inference, and Learning (CHIL) 2026