中文

良好的排序,错误的概率:多模态癌症生存模型的校准审计

机器学习 2026-04-07 v1 人工智能 定量方法

摘要

融合全切片组织病理学图像与基因组数据的多模态深度学习模型在癌症生存预测方面取得了强大的判别性能,以一致性指数衡量。然而,这些模型衍生的生存概率——无论是来自原生输出还是通过标准后验重建——是否经过校准,在很大程度上尚未被审视。我们进行了据我们所知的首个对多模态WSI-基因组学生存架构的系统性折叠级1-校准审计,评估原生离散时间生存输出(实验A:TCGA-BRCA上的3个模型)和来自标量风险评分的Breslow重建生存曲线(实验B:5种TCGA癌症类型上的11种架构)。在实验A中,所有三个模型在大多数折叠上均未通过1-校准(15个折叠级测试中有12个在Benjamini-Hochberg校正后拒绝原假设)。在全部290个折叠级测试中,166个在中位事件时间后在Benjamini-Hochberg校正(FDR = 0.05)下拒绝了正确校准的原假设。MCAT在GBMLGG上取得C-index 0.817,但在所有五个折叠上均未通过1-校准。门控融合与更好的校准相关;而双线性和拼接融合则不然。后验Platt缩放减少了评估时间范围内的校准不良(例如MCAT:从5/5折叠失败降至2/5),但不影响判别力。一致性指数单独不足以评估 intended for clinical use 的生存模型。

关键词

引用

@article{arxiv.2604.04239,
  title  = {Good Rankings, Wrong Probabilities: A Calibration Audit of Multimodal Cancer Survival Models},
  author = {Sajad Ghawami},
  journal= {arXiv preprint arXiv:2604.04239},
  year   = {2026}
}

备注

15 pages, 5 figures