评估医疗 DNN 的可靠性:基于特征与置信度的 OOD 检测的批判性分析
计算机视觉与模式识别
2024-09-02 v1 机器学习
摘要
在医学图像分析中可靠地使用深度神经网络(DNN)需要识别出与训练数据存在显著差异的输入,称为分布外(OOD),以防止错误的预测。OOD 检测方法可分为基于置信度的(利用模型输出层进行 OOD 检测)或基于特征的(不使用输出层)。我们通过将 D7P(皮肤科)和 BreastMNIST(超声)数据集划分为包含和不包含伪影(分别为标尺或标注)的子集,创建了两个新的 OOD 基准。模型使用无伪影图像进行训练,带有伪影的图像用作 OOD 测试集。对于每张 OOD 图像,我们通过图像处理手动移除伪影来创建反事实图像,以评估伪影对模型预测的影响。我们表明,由于训练数据中的相关性等因素,OOD 伪影可以提高模型预测的 softmax 置信度。这违背了 OOD 伪影应导致更不确定输出的普遍假设,而大多数基于置信度的方法都依赖于此假设。我们以此解释了为什么基于特征的方法(如 Mahalanobis 分数)通常比基于置信度的方法(如 MCP)具有更好的 OOD 检测性能。然而,我们也表明,基于特征的方法在区分导致正确和错误预测的输入(对于 OOD 和 ID 数据)方面通常表现较差。基于这些见解,我们主张应在 DNN 流水线中结合使用基于特征和基于置信度的方法,以减轻它们各自的弱点。本项目的代码和 OOD 基准可在:https://github.com/HarryAnthony/Evaluating_OOD_detection 获取。
引用
@article{arxiv.2408.17337,
title = {Evaluating Reliability in Medical DNNs: A Critical Analysis of Feature and Confidence-Based OOD Detection},
author = {Harry Anthony and Konstantinos Kamnitsas},
journal= {arXiv preprint arXiv:2408.17337},
year = {2024}
}
备注
Accepted for the Uncertainty for Safe Utilization of Machine Learning in Medical Imaging (UNSURE 2024) workshop at the MICCAI 2023