医学图像分类中的失败检测:现状检验与基准测试平台
人工智能
2022-10-25 v2
摘要
自动化图像分类中的失败检测是临床部署的关键保障。被检测到的失败案例可交由人工评估,从而在计算机辅助临床决策中确保患者安全。尽管其至关重要,但关于最先进的置信度评分方法在医学影像背景下检测分类模型测试时失败的能力,尚缺乏充分证据。本文提供了一项现状检验,建立了域内误分类检测方法的性能基准,在 6 个具有不同成像模态的医学影像数据集上、在多类和二分类设置下对 9 种广泛使用的置信度分数进行了基准测试。我们的实验表明,失败检测问题远未解决。我们发现,在计算机视觉和机器学习文献中提出的被基准测试的先进方法中,没有一种能持续优于简单的 softmax 基线,这表明改进的离群分布检测或模型校准并不一定转化为改进的域内误分类检测。我们开发的测试平台促进了这一重要领域的未来工作。
引用
@article{arxiv.2205.14094,
title = {Failure Detection in Medical Image Classification: A Reality Check and Benchmarking Testbed},
author = {Melanie Bernhardt and Fabio De Sousa Ribeiro and Ben Glocker},
journal= {arXiv preprint arXiv:2205.14094},
year = {2022}
}
备注
Published in Transactions on Machine Learning Research (10/2022)