分布漂移下无标签临床相关性能指标的估计
机器学习
2025-07-31 v1
摘要
性能监控是确保图像分类模型安全临床部署的关键。然而,由于目标数据集中通常缺乏真实标签,直接评估实际模型性能不可行。当前主流的性能估计方法通过利用置信度得分来估计目标准确率。尽管这一方法前景广阰,但在临床领域(常见强类别不平衡和数据集漂移)中,现有方法主要估计模型准确率,且鲜有在临床领域进行评估。我们的贡献有二:首先,我们引入了现有性能预测方法的推广形式,直接估计完整混淆矩阵。其次,我们在真实世界分布漂移下的胸部X光数据以及模拟的协变量和患病率漂移中对其进行基准测试。所提出的混淆矩阵估计方法可靠地预测了在分布漂移下医学图像中临床相关计数指标。然而,我们的模拟漂移情景暴露了当前性能估计技术在重要失败模式,呼吁在实际部署情境中更好地理解这些性能监控技术的实施,以进行医学AI模型的售后监控。
引用
@article{arxiv.2507.22776,
title = {Label-free estimation of clinically relevant performance metrics under distribution shifts},
author = {Tim Flühmann and Alceu Bissoto and Trung-Dung Hoang and Lisa M. Koch},
journal= {arXiv preprint arXiv:2507.22776},
year = {2025}
}
备注
Accepted oral at UNSURE 2025 @ MICCAI