通过临床背景重新审视胸片模型的性能声称
机器学习
2026-02-10 v2
摘要
胸片(CXR)的公共数据集长期以来是开发机器学习(ML)计算机视觉模型用于医疗保健领域的热门基准。然而,这些模型报告的强平均案例性能并不一定反映其在异构临床环境中的实际用途, potentially 掩盖了在医学上重要情景中的较弱性能。在本工作中,我们利用临床背景提供对当前“最先进”(SOTA)CXR诊断模型的更全面的评估。具体而言,我们利用在每次CXR检查之前记录的出院摘要,推导出每张CXR标签的“事前CXR”概率,用作临床医生在解释CXR时可用的最常见背景知识的代理。我们使用此 measure 来探讨模型在两个维度上的性能:首先,通过分层分析,我们显示模型在个体的事前CXR概率较高时(以AUROC等指标衡量)性能较低。其次,通过匹配和重新加权来控制事前CXR概率,我们展示了当先前背景与当前CXR标签之间的相关性被打破时,性能会下降,这表明模型性能可能部分取决于对事前CXR临床背景的推断。
引用
@article{arxiv.2509.19671,
title = {Revisiting Performance Claims for Chest X-Ray Models Using Clinical Context},
author = {Andrew Wang and Jiashuo Zhang and Michael Oberst},
journal= {arXiv preprint arXiv:2509.19671},
year = {2026}
}