中文

不确定真值下的人工智能系统评估:以皮肤病学为例

机器学习 2025-04-15 v2 计算机视觉与模式识别 统计方法学 机器学习

摘要

出于安全性考虑,医疗 AI 系统部署前需经过彻底评估,将其预测与假定固定且确定的真值进行验证。然而,该真值常以鉴别诊断的形式整理。单一鉴别诊断反映一次专家评估中的不确定性,而多位专家则通过分歧引入另一层不确定性。标准评估将此类鉴别诊断聚合为单一标签,忽略了这两种不确定性。本文中,我们表明忽略不确定性会导致对模型性能的过于乐观的估计,从而低估特定诊断决策相关的风险。为此,我们提出一种统计聚合方法,基于观测到的标注推断底层医疗状况候选本身的概率分布。该表述自然考虑了不同专家间的潜在分歧,以及来自个体鉴别诊断的不确定性,捕捉了完整的真值不确定性。我们的方法归结为生成医疗状况概率的多个样本,然后基于这些采样概率评估并平均性能指标。在皮肤状况分类中,我们发现数据集的很大一部分表现出显著的真值不确定性,且标准评估严重高估性能而未提供不确定性估计。相反,我们的框架在 top-k 准确率和平均重叠等常用指标上提供不确定性估计,显示性能可有多个百分点的变化。我们得出结论:尽管假定明确真值对许多 AI 应用可接受,但在医学诊断中应采用更精细的评估协议。

关键词

引用

@article{arxiv.2307.02191,
  title  = {Evaluating AI systems under uncertain ground truth: a case study in dermatology},
  author = {David Stutz and Ali Taylan Cemgil and Abhijit Guha Roy and Tatiana Matejovicova and Melih Barsbey and Patricia Strachan and Mike Schaekermann and Jan Freyberg and Rajeev Rikhye and Beverly Freeman and Javier Perez Matos and Umesh Telang and Dale R. Webster and Yuan Liu and Greg S. Corrado and Yossi Matias and Pushmeet Kohli and Yun Liu and Arnaud Doucet and Alan Karthikesalingam},
  journal= {arXiv preprint arXiv:2307.02191},
  year   = {2025}
}